上周那篇论文里有个词我很喜欢:structure pricing。
给结构定价。这个说法自带立场——它默认结构是要花钱的,而且花得不少。多数做 graph RAG 的人不这么谈,他们谈多跳、谈跨文档、谈召回率。
那些数字不是没意义。我是说账没算清的时候,这些数之间没法比。
结构该被定价,这事我之前想过一阵,一直没找到合适的落点。这篇论文给了个落点。
起点很朴素。基于图的 RAG 在摄入阶段要打大量模型调用:抽实体、判关系、连边,都不免费。既然不免费,就得回答一件事:质量涨的那一点,值不值多花的那些钱。
这个问法比结论重要。
但我真正停下来想的是另一件事。EffiRAG 的答案是从原始文本生成的,图只用来定位段落。
换句话说,到了答题那一步,图已经不在场了。图不在场,结果反而更好:120 个问题里 93 个更受偏好,对手赢 7 个,20 个打平。成本从 0.952 美元降到 0.408 美元,降了 57%。
"图不在场"这个说法太绝对,收紧一点:是图不再作为答案的素材在场。它仍然决定去哪里找素材。这活儿不小,找错了后面全错。
可如果图的核心职责是"指路",那它在系统里的角色就不是知识的容器,是目录。
目录不需要理解内容。目录只需要告诉你在哪一页。
顺着往下推:建图时那批调用里,有多少在做目录的活,有多少在做理解的活?
先把建图为什么贵说清楚。它要求模型对每一块文本都做一次结构化决定。抽实体是一次生成,判关系是一次生成,连边又是一次。每一步都要钱,而且这些决定的质量很难当场验证——你没法像看答案对不对那样,看一条边连得对不对。
论文里有个细节值得单独拎出来。在每领域 10 篇和 20 篇文档的设置下,EffiRAG 用轻量的、非语言模型的过滤器跳过低显著性文本块,成本分别是 LightRAG-hybrid 的 1/4.2 和 1/4.5。
非语言模型的过滤器。说白了就是关键词匹配那个量级的东西。
如果关键词过滤能扛下相当一部分筛选职责,那前面那些"每个 chunk 都过一遍模型抽实体抽关系"的调用,买的就不是理解,是覆盖面。因为不确定哪些块有用,索性全过。
我觉得这是图 RAG 里一个没被点破的默认假设:图和检索质量是同一样东西。
它们可能是两样。检索是路由,图只是路由结构里的一种。知识该怎么表征是另一个问题,那个问题贵得多,也难验证得多。这篇论文无意间把这两个问题分开了。
你可能会反对说,成本会降。模型越来越便宜,今天要打十万次调用的事,明年打一万次就够,现在纠结成本是短视。
绝对成本下降,不改变相对成本。模型便宜了,能负担得起的语料也变大了。去年只敢吃一万篇文档,今年敢吃一百万篇。分子分母一起长,比值不怎么动。决定一个架构能不能活的,从来是比值。
还有一层反对值得听:120 个问题、4 个领域,样本不大;开放式问题的偏好评判本身带噪声;20 个打平就说明在很多问题上两边其实没区别。
对,但那不是反驳,是补充。差异薄的地方比差异厚的地方更诚实。它说明多花的钱买的是保险,不是质量。
我确实对"定价"这个词有点偏爱,这里可能跑题。但定价这件事在图 RAG 里尤其少被做,原因不难想:图的成本在摄入阶段一次性付掉,质量收益在查询阶段慢慢显现。两个阶段的人往往不是同一批,甚至不在同一个季度里算账。付钱的和受益的对不上,这种结构下没人愿意先提成本。
我更在意另一个问题:为什么这个领域的论文,长期以来只报质量不报成本?
因为质量可以横向比,成本只能纵向比。你报成本,等于承认自己的方案贵。这是件伤自尊的事。
如果我对,接下来一年"成本"这一列会变成标配;图这个字会留下来,图构建里最贵的那部分会缩水。最后剩下的图,可能长得不太像现在大家画的那种图,更像一个建得比较讲究的倒排索引。
论文自己的结论是用图来定位并保留源证据。重点在后半句。听着像技术细节,其实是整篇的立场:图的职责是把你送回原文,不是替你总结原文。
回到那个词。结构定价。我觉得它比这篇论文里任何一个实验数字都活得久。
¹ 论文编号 arXiv:2609.18099,cs.AI 分类,2026 年 9 月 16 日提交 v1。本文涉及的数据都出自这一篇。
² 成本口径包含摄入和查询两个阶段的模型调用。语料规模扩大时,这个优势仍然存在。
³ 打平的 20 个问题本身没有方向。把它和 93 比 7 放在一起看,是 120 个问题上的一次分布,不是三个独立结论。
⁴ 我这里可能错了。图用于定位,定位错了整条链全错,承担的风险不比生成小。我要说的是它的职责被换了位置,不是它可有可无。
