七款开源模型答同一套题,最好的那款答对率不到一半
两周前挂上 arXiv 的一篇论文,标题长得没人愿意点开,讲的是开源模型在 ESG 报告里做检索问答。 本来我也差点滑过去。ESG 这三个字母离普通人远,论文里那些模型名,一半我都没听过。 但它里面有组数字,值得单独拎出来讲。 先说它测了什么。

两周前挂上 arXiv 的一篇论文,标题长得没人愿意点开,讲的是开源模型在 ESG 报告里做检索问答。 本来我也差点滑过去。ESG 这三个字母离普通人远,论文里那些模型名,一半我都没听过。 但它里面有组数字,值得单独拎出来讲。 先说它测了什么。

RAG 会不会把你的资料漏出去? 简单说:会。而且不用黑进你的系统,会提问就行。 问题不在模型记不记得住,在检索这条通路本身。RAG 让回答有据可依、幻觉少了很多,这是它被广泛采用的原因。同一套机制反过来用,就是一个出口。 攻击者要的不是权限,是提问的入口。 拿到入口之后,他能从底层语料里一点点把个人可识别信息抽出来。

十天前 ORDER 挂在 arXiv 上,2609.17012。我第一眼是真没想点进去。路由、检索增强,这俩词挨一块儿,我脑子里自动蹦十几篇同质化的东西。后来是扫到摘要里“同时调整索引和检索”这句,手又绕回去了。嘿,本来没打算开这头。 这堵墙我撞过。之前给一个历史文献检索的活儿做过东西,具体是啥不细说,免得你猜出来。

先说结论:这篇论文真正值钱的不是它推的 GCMem,是它顺手证明的那个 Majority Vote Trap——语义等价的冲突记忆里,把 context window 开大,生成准确率往下掉。 不是持平。是掉。 「窗口越大、塞得越多、效果越好」——这句线性叙事,在这条定理面前原形毕露。
速评:9 月 13 号挂上 arXiv 那篇法律奖励模型论文,最值钱的不是摘要里那个 25.6。 是它顺嘴交代的一句话——现有奖励模型是照着通用偏好优化的,不是照着"该不该开口"优化的。读着像句自谦,实际把整条评估链的底给掀了。 奖励模型的训练目标是啥?人类标注员在两坨回答里挑一个更好的。
AI 查了资料再回答,就一定更准吗。 不一定。 九月十四号 arXiv 上挂了一篇医学方向的论文,arXiv:2609.16301,三十一页。它处理的就是大家都跳过去的那一环:检索回来的证据互相打架的时候,信哪一个。 简单说,这篇讲的是裁决,不是检索。 这期本来想多收几条。

前两天翻 cs.AI 的新提交,点开了 9 月 13 日挂上去的 arXiv:2609.14408,标题 Dynamic Learning Solutions: A System for Personalized Educational Video Generation,五位作者,Siddhanth Sridha…

速评:这篇论文最该转的不是结论,是它自己招了在哪塌。 9月15号挂 arXiv 的 cs.AI 分类,9月16号出第二版,隔一天。14页正文配1张图。这个配置本身就有信息量——那些判断不是图跑出来的,是人一条条读答案读出来的。一天之内改了啥我没比对,不猜,可能是作者信息也可能是补表,不知道的事不编。
9 月 13 号挂上 arXiv 的 TriCalRAG,编号 2609.14762。标题里那个"基准"我没兴趣,戳我的是中间一段结果描述: zeroshot 下,两个开放权重模型基本退化,某些数据集上,把 100% 的事件都判成 anomaly。 一条不漏地报警,等于一条都没报。

先说结论:arXiv 2609.17709 这篇里最值钱的,不是 DRAG 这个框架名,是它在分析部分撂下的一句话——「并非所有查询都适配更高的复杂度配置」。 看着像废话。同行都懂。但它是冲着谁去的,得说清楚。 现在大部分 RAG 管道的默认形态是:一套检索器配一个生成模型,所有 query 走同一条路。

先说结论:arXiv 2609.17983 这篇,正文里那个发现值钱,摘要结尾那句「可以无条件采用」不值钱。同一篇论文,前者有数据兜着,后者被它自己的实验打脸。 9 月 16 号挂上去的,Mingyang Mao、Wyatt Mackey、Xiaomin Lin 三个人的活,cs.AI 分类。

agent 答错的时候,第一反应总是模型不行。 这周收的几条材料给的是另一个答案:它该知道的东西散在别处,模型压根不知道那些东西存在。 散在哪?文档里、工具返回里、聊天记录里、issue 评论里、AGENTS.md 里、本地文件里、几个 API 的响应里。都在,就是不在它眼前。 dev.to 八月下旬那篇拆得最清楚。

翻一篇 dev.to 上的 RAG 复盘,正文那五条经验扫过去,真正让我停下来的东西在评论区里。整条线最后长到比正文还长,绕着一个数转:0.92。 背景是个很典型的受困环境:内网,没有 GPU,Mistral 7B 跑在 4 vCPU / 16 GB 上,一个完整回答 60 到 120 秒。
这篇论文我读了两遍。最让我不舒服的倒不是实验结果本身,而是这个结果照出来的一层幻觉——我们这行最近又有人开始把“知识塞进权重”当成 RAG 的替代品在吹了。省 token、不泄露源数据、查询快,听着全对。但这篇论文自己把话说到了一个很尴尬的位置:知识确实写进去了,可怎么读出来,没人知道。 先说这论文干了什么。

先说结论:这次没有通稿可拆,没有跑分可打,也没有价格表可以算账。八月底 dev.to 上冒出来一个自托管文档库叫 Kintara,我照了一圈,没找到想踩的点。 在我这儿,这属于罕见事件。 我本来是准备踩的。 dev.to 上这类项目跟野草一样,每个月长一批。

为什么一篇讲专利检索的论文,值得放进本期小抄。 因为它把 RAG 里一直由人来干的那一步,交给了模型自己。 这篇 8 月 11 日挂上 arXiv,编号 2608.11030,主分类 cs.IR,交叉列了 cs.CL。九个作者,第一作者 Jian Zhang。同时也被 IEEE CSCWD 2026 接收了。

多智能体防幻觉这事儿被讲得越来越玄。玄到好像 agent 一多、让它们互相吵两句,幻觉就自己没了。 上个月翻到一篇金融问答的论文,CLAIRFin,arXiv 2608.13706,我点开的时候已经更到第三版了。九个智能体。第一反应:哦,又是个堆 agent 的。 从头看到尾,那九个根本不是重点。
前几期塞得满,这周只收一条。 不是没动静。是动静都太吵,挑不出一句能对普通人讲清楚的白话。吵的那些下周再说。 留下来的这条,8 月 25 号挂在 arXiv 上,cs.CL,交叉到 cs.IR,作者两个人。标题里有个 Less can be More。这种标题一般两种下场,要么标题党,要么真把常识说反了。 这条是后者。
RAG 这个名字起得就坏。它把"检索"两个字摆在前头,于是所有人都在卷检索,后半截那根管子没人回头看。 前阵子点开一篇讲多智能体出题的——八月十三号挂上 arXiv,cs.CL,编号 2608.13708,叫 TeachMateGPT。我本来是冲着"多智能体"去的。
最近又有人问,RAG 到底解决了什么。 简单说,它让模型先查资料再开口,不是全靠脑子里记着的那点东西。 问题是,查到的资料本身可以是错的。 八月底有篇论文就是冲着这件事来的。ReliableRAG,arXiv 编号 2608.25487,主分类 cs.CL,九个作者,第一作者 Jinpu Jiang。
