跳到主要内容
完美上下文也抹不平的地区差——读 arXiv:2608.25717 笔记

完美上下文也抹不平的地区差——读 arXiv:2608.25717 笔记

P99
P99

· 阅读约 5 分钟

社区里流传着一句话:"检索给得足够好,RAG 的答案就应该是对的。"这说法很难验证,因为几乎没人真把"足够好"推到极端来试。多数 RAG 评测跑的是端到端管线,检索结果里总混着不相关片段、截断的表格、过时的财报摘要,最后结论全赖在检索头上。arXiv 上两周前挂了一篇论文,2608.25717,投的 COLM,终于有人把"上下文干不干净"单独拎出来当变量测。测出来的意思不太妙:上下文干净得不能再干净,模型该不知道还是不知道。

先说口径。他们选了约 2000 家全球上市公司,把每个要问的事实拆成可独立判对错的原子属性,6 个开源模型各跑 4 种输入条件:无上下文、完美上下文、误导上下文、干扰上下文。没有端到端 RAG——不是不检索,是把检索环节拿掉,单独看模型怎么处理已经躺在上下文里的答案。这个设计好在哪?前两种一对照,"上下文本身是错的"这个变量就隔离掉了。只跑"有 RAG 和没 RAG"的对比永远做不到这一点,因为真实检索返回的内容你没法保证纯净。这几组条件把预训练知识、上下文利用率、误导抗性拆成了独立的变量,比端到端的一锅烩干净得多。

无上下文那组算打地基:模型对上市公司事实问答的准确率,地理区域差异相当明显。别急着说"早知道了"——它证明的是这个差距的形状:和真实经济分布对不上,和股票指数的市值权重也对不上,更像沿着预训练语料文本可见度画的一条线。英文材料密度高的地区准确率高一截,覆盖薄弱的地区掉一截。到这里符合预期,基线的合理性算验过了。

真正让我停了一下的是第二条。他们把"完美上下文"做得很极端——相关事实全文给出、格式干净、没有一句废话,相当于人类开卷考试时答案已经帮你翻好了那一页。结果:地理差距没有消失,形状都还在。而且增益幅度跟模型原本的基线准确率正相关:本来熟的地区,给了完美上下文涨更多;本来不熟的地区,给了完美上下文也涨不动多少。这不是知识平权,是马太效应。RAG 不是把参数知识的地基补平,它是在原有地基上盖楼。地基好的地方盖得高,地基差的地方连楼都立不住。

这跟我们做 RAG 优化时的直觉是拧着的——我们默认"模型不知道没关系,上下文里有就行"。论文的意思其实是:行不行,取决于它是哪种"不知道"。一个实体在模型参数里是零散的还是成体系的,直接决定上下文里的新事实能不能被组装进去。检索给得再准,模型内部没有对应的钩子,答案也只是飘在上下文里的一段字,读不进去。

误导上下文那组结果没让我意外,但锤实了一件事:当上下文里出现错误答案时,模型复述错误的倾向相当强,不是轻微受影响,是照着错答案抄。幻觉没被 RAG 解决,只是换了个来源——从模型自己编一个,变成从检索结果里挑一个抄。检索质量当然是防线,但把"RAG 修正幻觉"当卖点的团队应该问自己一个问题:检索链路敢不敢拍胸脯保证永远不混进一条错信息?我是不敢。这篇的数据说,只要混进去一条,抄错的概率就值得把它当正经失败模式来设计,而不是当离群值。

6 个模型给了参数规模的对照。好消息是大模型整体准确率更高。坏消息是:没消除。地理差距、完美上下文下的吸收差距、误导上下文里的抄错倾向——大模型只是整体抬了水位,结构性的偏差还在。我本来期待规模能带来质变,参数量大了,内部表征冗余度高,对陌生实体的容纳能力理应更强。测出来没有这回事。方差是缩了,偏差的形状没变。这比"大模型也不行"更值得琢磨——这是从预训练语料分布里带出来的惯性,不是能力天花板的问题。

上个月我正好在自己那份测试表里撞到过一个类似的形状。测的是一组偏冷门的公司事实问答,检索结果给得很干净,上下文里答案齐全,模型答不对——不是答不出,是它更愿意相信自己记忆里那个残缺的答案。当时样本量只有个位数,我记了"待复测"没敢拿出来。这篇等于在我那几行笔记下面补了一个 2000 家公司的样本。自己踩过的坑被一篇论文用大样本复现了一遍,心情有点复杂,一方面手感被验证了,另一方面这验证的价格是 10 页 COLM 投稿。

论文没有附代码或数据脚本的链接,我翻了一遍没找着,也可能投稿版还没补。严格说上面全是我的阅读转述,不是独立复跑。但测试框架本身是可复制的:2000 家上市公司、4 种上下文条件、6 个开源模型——哪天作者把基准集放出来,本地重跑不是难事。到时候我打算拿自己常做的领域问答再测一轮,看看"增益与基线正相关"这个形状在别的知识类型上还站不站得住。

置信标签:方向大致对。"完美上下文抹不平区域差异、收益与基线正相关"这两条在这篇数据范围内能站住。但样本局限在上市公司事实问答这一类结构化知识,换成长文档问答或多跳推理,形状变不变,证据还不够,先别急着推广。欢迎拿自己的场景复测,数字对不上告诉我。