跳到主要内容
72% 这个数字,撑不过论文第三页

72% 这个数字,撑不过论文第三页

嘴替
嘴替

· 阅读约 4 分钟

速评:9 月 16 日挂上 arXiv 的那篇文化 QA 论文,卖点就一个数字——知识图谱把错误率砍掉 72%。

编号 2609.18317,cs.CL,三个作者,标题长到像把三个关键词直接焊在一起。这两天几个群里转的文案,基本是同一个模板:"KG 暴打 RAG"。我不信。理由不在技术层面,在这篇论文自己的措辞里。

先说这 72% 是什么。是错误率下降,不是准确率涨了 72 个点——在文化类多选题上这俩差得远。base 模型碰上长尾文化题本来就答得一塌糊涂,从 40 涨到 65,和从 10 涨到 30,错误率降幅看着差不多,实际差着量级。摘要里没摆 base 的绝对水平,只挂了个带百分号的相对数。这处留白很讲究,换谁都得这么写。

真正让我停下来的是论文里另一句话,意思大概是:图谱越往贴着任务内容的方向去组织,Graph-RAG 和 RAG 之间的差距就越小。

翻译成人话——那个 72% 出现在差距最大的那一档配置上。图是 KGGen 从维基百科端到端抽出来的,零人工整理,这个配置本身没问题;但作者等于自己承认了,图谱和检索之间的差距不是一个架构常数,是个可调的旋钮。你往图里塞进越多贴着题目的结构,另一边的检索也跟着变好,两边往一块收。那这个旋钮拧到哪一格才算"KG 比 RAG 强"?论文给的是一格上的快照,不是一条曲线。差距最大的那一档,恰好也最容易出标题数字。这句话我在转发的文案里一次都没看见。不意外,抄摘要的人只抄带百分号那句。

再说图是怎么来的。KGGen、维基百科、端到端、零人工。这个设定,比"我们手工建了个领域图谱,然后证明它比检索好"那批诚实多了——手工建图再跟 RAG 比,那是自证,答案本来就在图里,赢是应该的。这篇没走那条路,这点给它记上。

但代价是:图和检索抓的是同一个维基百科。那差距到底来自"结构化表示"本身,还是来自抽取器顺手做掉的那层过滤和压缩?论文没把这两件事拆开。我在这儿打个问号。

还有一条埋得很深的:投影层不用目标语言微调,零样本迁到葡萄牙语。

这条比 72% 有意思得多,如果它站得住。它说的不是"我们支持多语言"那种通稿话术,是训练出来的对齐方式本身带着某种跨语言的结构——图那一侧的组织逻辑,可能比语言本身更通用。要真是这样,后面半年会有人在别的地方接着验。

不过这回我也不打算给它鼓掌。LatamQA 是拉美文化导向的多选题,八个主题类别,葡萄牙语和西班牙语的维基覆盖本来就高度重叠。这个迁移测试的难度里有多少是被数据集自己摊薄的,我拿不准,作者也没展开。先记着,不下结论。

顺便交代一下我这篇的论证方式:实验我没跑,也不打算跑。证据全部来自论文自己的措辞和前后对齐关系,不是复现出来的数字。在这个题上够用——我要拆的不是它准不准,是它选择把哪一句放进摘要、把哪一句塞进正文中段。

这里立个 flag:三个月内不会冒出第二篇独立复现,把那个 72% 原样端出来,能复现到一半就算不错。理由是错误率相对下降这种指标太脆,抽取器换个版本、chunk 切法换一档、题目分布稍微动一下,出来的数就能差出一大截。方向我猜是对的,结构化上下文处理长尾文化事实确实有优势,这个方向不用怀疑。幅度,保留。

最后一句可能不太舒服:这类论文的价值,往往不在它证明了什么,在它暴露了什么。这篇暴露出来的是——"KG vs RAG"这个提法本身可能就立不住:两边共享同一个语料来源,共享同一批长尾盲区,差距只落在中间的表示层和过滤层,而这两层的可调空间又大到能把结论拧来拧去。真正该问的不是谁更强,是什么条件下哪一边被喂了更多贴着题目的信息。