跳到主要内容
速评:你们都在看 SearchWiki 的跑分,没人看题目里那个词

速评:你们都在看 SearchWiki 的跑分,没人看题目里那个词

嘴替
嘴替

· 阅读约 4 分钟

速评:这篇论文 8 月 30 号挂上 arXiv,到今天六天,我没见一个人把它真正值得聊的那句话挑出来。不是“9B 打平更大模型”,是题目里那个动词:Learning to Navigate。

它把 RAG 的语料观,从“平的”改成了“带结构、可以走的”。

框架本身不玄。SearchWiki 把语料库码成三层:文档概览、跨文档主题页、页面级来源记录。懂行的到这儿就反应过来了——它不是又一个把 top-k 调成 top-m、再塞个 reranker 的活,它先把“检索的对象是什么”这个默认设定给掀了。语料库不再是一堆被切平的 chunk,是有入口、有路径、有出处的东西。

然后它训了个 9B 的检索 agent,Qwen 底座,用在线强化学习学导航策略。奖励函数听上去也不花哨:答案正确性、检索质量、轨迹效率。五个 benchmark 跑下来,比同规模不训练的基线强,还够到了更大的外部模型。

先说实话:我没跑过它的实验,这篇的判断只对到“思路”这层,不对到复现。我想拆的是这个思路本身——它比那几个跑分有意思多了,也危险多了。

RAG 火了这几年,检索组件基本被当成一道最优化题在做。embedding 选哪个、top-k 设多少、要不要 rerank。默认前提是语料进检索器之前就该是平的——切好,embedding 好,往向量库一丢,完事。几乎没人停下来问一句:文档和文档的关系、主题和主题的路径,是不是在这套流程里早就被扔了?

SearchWiki 最狠的地方,是它压根不跟你讨论 embedding 怎么调。它不觉得检索是个“在一堆碎片里找最像的”的问题,它觉得那是“在一张地图里找路”的问题。模型先落到文档概览层,判断这篇文档跟我的问题有没有关系,再决定往哪个主题页跳,再顺着主题页的链接下到来源记录。每一步都是决策,不是一个相似度分数。

这套说法的底气在于:人的阅读本来就是这么干的。没人会把一本书从头到尾读完再回答问题。人是翻目录、跳词条、从词条的引用再跳到下一处——检索从来不是扫射,是人在结构里做选择题。SearchWiki 无非是把这常识教给了模型。

9B 那个数字搁这儿,信号被大家忽略得有点冤。2026 年九月的语境里,9B 就是轻量级选手。它够到更大的外部模型,不是靠拉长 context window,也不是靠堆参数。它赢的方式是先把地形修好,再让模型学会在这片地形里走路。把语料重组成知识维基、再让小模型学导航——这个组合说的事比“小模型也能行”大:你喂给模型的东西长什么样,可能比模型本身多大更值得花力气。

但这里我得留个心眼。带导航的 agent 有条经典翻车路径:奖励函数学出来的“走路姿势”在 benchmark 上很好看,换一片新语料直接不会下脚。这篇的多组件奖励——答案正确性加检索质量加轨迹效率——三个目标叠一块儿,是在调教导航策略,还是在过拟合那几条 benchmark 的路径,我现在看不出来,得等社区复现再说。

这里立个 flag:如果后续复现崩了,崩的地方大概率在 RL 策略的迁移,不在知识维基的结构本身。结构是对的,学出来的走路姿势未必。

还有一点值得多看两眼:它挑在离 ICLR 投稿季不远的时间挂出来,作者栏一串 IBM 研究院的名字。这种论文每年上千篇,多数沉底。但 SearchWiki 不是又一个“我们提出一个优雅框架”然后没下文的东西。它把问题从“检索够不够准”改成了“语料是不是真的被读懂了”。这话不好听,但真。

如果这个方向是对的,那些还在 embedding 精度上磨刀的人,手里的活可能不是磨刀——是在磨一把本来就不该出鞘的刀。