速评:8 月 25 号 arXiv 上挂了篇 RAG 攻击与防御的综述,标题翻过来九个字——检索到了,但不可信。
这九个字,比里面 24 页正文都值钱。
真正露馅的不是标题,是分类号。cs.CR 打头,密码学与安全,cs.CL、cs.LG 跟在后头。一篇讲检索增强生成的论文,主战场摆在安全圈、不在 NLP 圈,这个排位比它自己的摘要诚实。
RAG 卖了这几年就一句话:把外部知识喂进去,幻觉就少了。整套话术压着一个从没被验证过的前提——检索回来的东西是真的。这篇干的就是拆这个前提。语料库能投毒,检索器能带后门,生成器能被诱导着把脏东西当依据念出来;连公平性都跑不掉,同一个问题换个人群问,答案不一样,这个局在检索那一步就能做。每层都能被单独撬,链条最弱的一环说了算。
这些条目两年前就有人一条条列过,不算新。新的是把它们塞进同一个框架:语料库、检索器、生成器三层各形式化一套威胁模型,攻击按目标归三类,防御按流程分四段对齐。
13 个作者,横跨 cs.CR、cs.CL、cs.LG。这个作者名单本身就是信息。写这么一篇东西,得让安全圈和 NLP 圈坐一张桌子,而这两拨人互相看不上是有年头的:安全圈嫌 NLP 的 benchmark 是过家家,NLP 圈嫌安全圈的威胁模型是吓唬人。现在合写了。合写这件事,比写出来的结论更有信息量。
版本号我本来想再挖一层。8 月 25 号投的第一版,8 月 27 号出的第二版,中间隔一天。翻了两遍,没翻出能用的东西——arXiv 上隔一天出个修订,改改作者顺序、补两条引用就够了。硬从这个时间差里读节奏,是我自己给自己加戏,这条撤。
一个技术什么时候开始密集地出安全综述,有规律。不取决于它自己成熟到什么程度,取决于它被部署到了什么位置。RAG 前两年是 demo 阶段,比的是召回率和准确率,谁管你语料库是谁写的、谁有权改;今年被塞进客服、法务、内部知识库,检索回来那份文档是要签字负责的,安全圈这才进场。所以这篇不是说 RAG 不行了——它说的是 RAG 已经长到了有人必须为它写威胁模型的体量。
还有个更冷的事实:一个方向开始出这种统一框架+形式化威胁模型+分阶段防御的综述,通常意味着增量研究的边际收益已经在往下走。路修不动了,才需要一张地图。学术界给工业界做追认,历来这个节奏,滞后半年到一年,位置基本不动。
补一句,它已经被 EMNLP 2026 的 Findings 收了,走的 ARR 评审线。这话接下来会被怎么用我大概猜得到:"顶会背书的 RAG 不可信"。别。顶会收一篇综述,收的是它分类学清楚、文献梳理得全,综述这个体裁本来就不产出新证据。接收函和结论成立之间,隔着一整个复现的距离,混着说就是拿接收函当论据。
要说这篇纯是学术圈自娱自乐,也不公道。之前那批 RAG 安全的文章,各写各的:这篇讲投毒,那篇讲注入,威胁模型各定各的,防御一个防检索一个防生成,接不上茬。这篇的增量是把攻击目标和防御阶段焊成一张表,听着像八股。真在这行待过的人知道,把两套不相干的词汇表并成一套,是最枯燥也最难有人愿意干的体力活,而这种事往往比多刷一个点 benchmark 有用。
四个防御阶段里我盯的是最后一个,溯源。前面三个是拦,最后一个是拦不住之后往回查。这个位置摆得有讲究:等于承认了语料投毒这种事防不干净,那退一步,至少得保证出事之后能追到是哪份文档、哪个环节把话带歪的。从"不让脏东西进来"退到"进来之后查得出是谁干的"——这一退,比通稿里任何一个形容词都诚实。防御思路里每一次后退,背后都压着一批真实的失败案例,没有哪个团队是自愿退的。
这里立个 flag:它提的那套威胁模型分类,一年之内会出现在不止一家厂商的安全白皮书里,措辞大概比原文温和,骨架是同一副。等"检索到了不等于可信"从论文标题变成采购清单上的一行验收项,今天这篇东西的性质也就变了——它不是在报警,是在提前写好免责声明。