睡前刷 arXiv,本来就想看一眼 RAG 这摊子又卷成什么样了。结果刷到一篇:2026 年 8 月 16 号提交,编号 2608.15919,题目叫 Noesis,摘要写的是“解耦的 Graph-RAG 架构”,HotpotQA 上 59.5 的 EM、74.7 的 F1,比 GraphRAG 高出 27.8 个精确匹配点。
我第一反应不是鼓掌。是活见鬼了。
27.8 个 EM 点。不是 2.78,不是比肩。是干翻。这头牛今晚非钻穿不可。我这不钻到底不舒服斯基的毛病,又犯了。
先说我为什么对这个数字犯恶心。倒不是说 GraphRAG 不能被打败,我不舒服的是那股味道:数字漂亮得不像话的时候,多半有东西被藏起来了。跟你写 CSS 在 Chrome 上美滋滋、上了 iOS Safari 就塌,一个味儿。
去翻论文。14 页正文,6 张图,4 张表,信息密度是够的。但四个算法平均下来每个能分到三页半。这笔账先记着。
第一个让我停下来的点:论文说构建图用的不是 GPT-4o,是一个 35B 参数的本地部署模型。
等等。这不对劲。
一般这种 Graph-RAG 的论文,图构建这步恨不得用最强的模型来抽实体、抽关系、打分,因为这步质量直接决定后面的检索天花板。你拿个 35B 的小模型去建图,然后把 GPT-4o 级别的基线按在地上摩擦 27.8 个点——这要不是图构建范式上真有什么颠覆,就是评测或者实现细节里有名堂。
结果我去找它的图构建细节。就寥寥几句。几句话里讲了个大概,说有个“带图反馈上下文解析器的双向图遍历”。然后没了。
嘿。这谁受得了。
图构建是这整件事的地基,你抽的边错了,后面检索再花哨也是白搭。可偏偏这块最关键的地方,论文用最少的话交代过去了。我一开始以为是我漏读了什么 appendix,翻回来一看,正文就 14 页,没有 appendix。还不死心,跑去 arXiv 页面上找代码链接——没有。这时候我才慢慢明白那股恶心从哪来:不是它用了 35B,而是它把最该交代的那点画了个漂亮的框,然后不给框里装东西。
我又回头去扒那个 27.8 到底怎么来的。HotpotQA 的 1000 个问题,59.5 EM、74.7 F1,写得清清楚楚。但 HotpotQA 是英文多跳问答,答案往往短,拼写敏感,EM 这个指标天生对短答案友好。问题集是固定的 1000 个,你优化到那个集上的时候,到底优化的是模型能力,还是这个集本身的气味,只有自己知道。论文不会替我回答这个。
接着我钻第二点:长距离因果边。
论文里说,在一个 193 页文档的源文本验证里,Noesis 对长距离因果边的识别精度到了 90%,而这些边“无法通过独立的块抽取获得”。
这句话本身没错,静态分块断语义是老问题了。但 90% 这个数,是在一个 193 页的文档上测出来的。一个。一个文档上 90%,换 100 个文档还剩多少?我翻遍正文,没找到第二个验证这个精度的数据集。这是不是有点像你在自己那台电脑上把 CSS 动画调到丝滑,然后就说“Safari 也没问题”——谁信谁倒霉。
再说那四个算法。不是都说它“解耦”吗,那我就一个个看,看解耦之后是清爽了,还是把锅甩给了下一层。
第一个,双向图遍历,配一个“带图反馈的上下文解析器”。这个“反馈”我盯着架构图找了好久,没找到收敛条件。它是固定轮数?还是损失不降就停?正文好像默认我已经知道答案了。行,算我蠢。
第二个,AIMD 并发控制器,说是借鉴 TCP 的拥塞控制。
这个名字刚看到时我真觉得性感。TCP 的 AIMD 我熟:加性增、乘性减,拥塞窗口自己会收敛,不怕网络抽风。但图检索里你的“拥塞”到底是什么?是打开的图节点数?是 chunk 并发读取数?是 token 预算的余量?TCP 里拥塞窗口有明确的度量——未确认包的数量——你这里的“拥塞”度量是什么?
我把论文里那个画着 AIMD 的框图来来回回看了十几分钟。没有答案。就一个框,里面写着 AIMD,旁边几条线画得规规矩矩。这时候我忽然有点明白了:它要的可能就是“AIMD”这四个字母给你带来的那种“哦,数学上很稳”的错觉。跟 CSS 里某些看起来像新属性、其实只是旧东西换个拼写的奇技淫巧一个德性。
第三个,Moesis,面向 MoE 模型的域感知选择性量化。
MoE 模型量化是出了名的难。难在专家路由是动态的,输入不同,激活的专家不同,你量化哪几个?全量量化精度掉,量化一部分又怕路由踩到没量化的专家上去。Moesis 说它是“选择性量化”,域感知。
好。那你怎么选的?选择的依据是什么?正文里我翻到剩最后一页的时候,终于看到一句让我差点把键盘拍了的话:有专利申请待审。
专利申请待审。
我卡在这行字上卡了好一会儿,像在 caniuse 里查一个属性,支持那一栏标着绿色,旁边 issue 列表里却全是“在真实项目里会炸”。不是不支持,是不让你看清楚支不支持。
第四个,Mesh,跨知识库语义路由。
这个听起来最像 if-else。路由这事说简单也简单,说难也难。简单的时候就是个 prompt 让模型分个类,难的时候是几十个领域知识库,查询来了要动态判断走哪个,还得处理跨领域的混合查询。但 Mesh 到底是模型做的路由,还是规则做的路由?读完整个正文,我没看出它的“语义”是哪一层的语义:是 query 的语义,还是知识库的 schema 语义?
好,停一下。我写了这么多,你可能觉得我是在骂这篇论文。其实不是。我骂的是那种“架构图漂亮、数字好看、但是把最该交代的那几行字藏进专利里”的劲儿。这跟 AI 写 CSS 写到 Safari 就“看起来对”是一路货:在外行看来全绿,在我这种不钻到底不舒服的人眼里,全是洞。
照我被前端养出来的习惯,把 Noesis 这四个模块和它声称的贡献拉个表,备注里是我作为一个“必须亲眼看它怎么掉坑”的人的读感。
| 模块 | 声称贡献 | 备注(我的读感) |
|---|---|---|
| 双向图遍历 + 图反馈上下文解析 | 带反馈的上下文解析 | 反馈对象、收敛条件不明,像被吞了 |
| AIMD 并发控制器 | 借 TCP 拥塞控制 | “拥塞”度量没给,像借个名 |
| Moesis 量化 | 面向 MoE 的域感知选择性量化 | 最核心的选择策略被专利申请待审挡着 |
| Mesh 语义路由 | 跨知识库语义路由 | 路由函数本身长什么样不知道 |
表看下来,最拉胯的还是最后那个——专利申请待审。你永远可以相信“专利待审”在可复现性上给你整点阴间活儿。我甚至不怪它 14 页写不完;我怪的是它留给读者的那一版,恰好漏掉了所有能让“27.8 个点”反过来被拷问的细节。
钻到这,我心里已经有一半答案是“它未必真比 GraphRAG 强这么多,更可能是图构建那半步做出了别人没做的约束,评测方式把贡献放大了”。但这是我的推测,关键细节被专利盖着。我卡了俩小时,中间一度拍桌子说这论文是不是标题党,后来想想,标题党还需要吹 35B 干翻 GPT-4o,只能说现在的 arXiv 也在卷叙事。
读这篇论文的时候,满脑子都是“结构性问题”。Graph-RAG 的老毛病是静态分块,Noesis 说它解耦了。但解耦这个动作本身是有代价的——你把流水线拆开了,模块之间的通信和一致性问题就冒出来了。14 页正文里四个算法各自亮个相,但模块之间怎么协同、出错了谁背锅、路由在真实多领域部署里怎么不掉链子,都没影。这就像前端你说把样式拆成 CSS Modules 就“解耦”了,结果全局级联照样穿透,你只是把坑换了个位置。
最后,说个跟这头牛八竿子打不着的。昨晚上我为了写这个,把浏览器标签页从 47 个关到剩下 3 个,其中两个是 caniuse 的页面,另一个是外卖。我突然觉得,arXiv 的论文和 caniuse 的表格有一个地方特别像:它们都只告诉你一个东西“支持”或者“比基线强”,但都不负责告诉你它在真实项目里会不会塌。真正动手的人,只能一个版本一个版本去试。这篇 Noesis 我试不了了——不是没有环境,是没有货。可越是没有货,我越觉得那个 27.8 的漂亮数字像个没写兼容性表的前端库:看着能用,一上真项目就现原形。
扯远了。反正——嘿嘿,下次见。
