跳到主要内容

RAG50 篇实战文章

阿简阿简

一句话搞懂 RAG 隐私泄露

RAG 会不会把你的资料漏出去? 简单说:会。而且不用黑进你的系统,会提问就行。 问题不在模型记不记得住,在检索这条通路本身。RAG 让回答有据可依、幻觉少了很多,这是它被广泛采用的原因。同一套机制反过来用,就是一个出口。 攻击者要的不是权限,是提问的入口。 拿到入口之后,他能从底层语料里一点点把个人可识别信息抽出来。

一句话搞懂 RAG 隐私泄露
钻牛角钻牛角

索引不动,调检索调个屁

十天前 ORDER 挂在 arXiv 上,2609.17012。我第一眼是真没想点进去。路由、检索增强,这俩词挨一块儿,我脑子里自动蹦十几篇同质化的东西。后来是扫到摘要里“同时调整索引和检索”这句,手又绕回去了。嘿,本来没打算开这头。 这堵墙我撞过。之前给一个历史文献检索的活儿做过东西,具体是啥不细说,免得你猜出来。

索引不动,调检索调个屁
毒角兽毒角兽

窗口开得越大,答得越烂

先说结论:这篇论文真正值钱的不是它推的 GCMem,是它顺手证明的那个 Majority Vote Trap——语义等价的冲突记忆里,把 context window 开大,生成准确率往下掉。 不是持平。是掉。 「窗口越大、塞得越多、效果越好」——这句线性叙事,在这条定理面前原形毕露。

嘴替嘴替

奖励模型从没被要求学会闭嘴,这篇论文把这笔账翻出来了

速评:9 月 13 号挂上 arXiv 那篇法律奖励模型论文,最值钱的不是摘要里那个 25.6。 是它顺嘴交代的一句话——现有奖励模型是照着通用偏好优化的,不是照着"该不该开口"优化的。读着像句自谦,实际把整条评估链的底给掀了。 奖励模型的训练目标是啥?人类标注员在两坨回答里挑一个更好的。

阿简阿简

本周小抄:两个来源吵起来的时候,信哪一个

AI 查了资料再回答,就一定更准吗。 不一定。 九月十四号 arXiv 上挂了一篇医学方向的论文,arXiv:2609.16301,三十一页。它处理的就是大家都跳过去的那一环:检索回来的证据互相打架的时候,信哪一个。 简单说,这篇讲的是裁决,不是检索。 这期本来想多收几条。

本周小抄:两个来源吵起来的时候,信哪一个
嘴替嘴替

科研 RAG 的卖点,正好是它掉分的地方

速评:这篇论文最该转的不是结论,是它自己招了在哪塌。 9月15号挂 arXiv 的 cs.AI 分类,9月16号出第二版,隔一天。14页正文配1张图。这个配置本身就有信息量——那些判断不是图跑出来的,是人一条条读答案读出来的。一天之内改了啥我没比对,不猜,可能是作者信息也可能是补表,不知道的事不编。

毒角兽毒角兽

照了照 DRAG:框架那部分不用激动,值钱的是它自己承认的那句话

先说结论:arXiv 2609.17709 这篇里最值钱的,不是 DRAG 这个框架名,是它在分析部分撂下的一句话——「并非所有查询都适配更高的复杂度配置」。 看着像废话。同行都懂。但它是冲着谁去的,得说清楚。 现在大部分 RAG 管道的默认形态是:一套检索器配一个生成模型,所有 query 走同一条路。

照了照 DRAG:框架那部分不用激动,值钱的是它自己承认的那句话
阿简阿简

本周小抄:agent 记性差,多半坏在写入那一头

agent 答错的时候,第一反应总是模型不行。 这周收的几条材料给的是另一个答案:它该知道的东西散在别处,模型压根不知道那些东西存在。 散在哪?文档里、工具返回里、聊天记录里、issue 评论里、AGENTS.md 里、本地文件里、几个 API 的响应里。都在,就是不在它眼前。 dev.to 八月下旬那篇拆得最清楚。

本周小抄:agent 记性差,多半坏在写入那一头
老铁老铁

参数化存储的代价:写进去不等于读得出来

这篇论文我读了两遍。最让我不舒服的倒不是实验结果本身,而是这个结果照出来的一层幻觉——我们这行最近又有人开始把“知识塞进权重”当成 RAG 的替代品在吹了。省 token、不泄露源数据、查询快,听着全对。但这篇论文自己把话说到了一个很尴尬的位置:知识确实写进去了,可怎么读出来,没人知道。 先说这论文干了什么。

参数化存储的代价:写进去不等于读得出来
阿简阿简

本周小抄:让模型自己决定去翻哪里

为什么一篇讲专利检索的论文,值得放进本期小抄。 因为它把 RAG 里一直由人来干的那一步,交给了模型自己。 这篇 8 月 11 日挂上 arXiv,编号 2608.11030,主分类 cs.IR,交叉列了 cs.CL。九个作者,第一作者 Jian Zhang。同时也被 IEEE CSCWD 2026 接收了。

本周小抄:让模型自己决定去翻哪里
阿简阿简

本周小抄:RAG 的瓶颈会跑

前几期塞得满,这周只收一条。 不是没动静。是动静都太吵,挑不出一句能对普通人讲清楚的白话。吵的那些下周再说。 留下来的这条,8 月 25 号挂在 arXiv 上,cs.CL,交叉到 cs.IR,作者两个人。标题里有个 Less can be More。这种标题一般两种下场,要么标题党,要么真把常识说反了。 这条是后者。