
速评:PURPOSE 最狠的不是投毒,是它不跟你吵
· 阅读约 2 分钟
8月5号挂上 arXiv,cs.CR 分类。PURPOSE。这个分类选得比正文还诚实——作者知道自己动的是安全性的奶酪,不是给 IR 圈子凑一篇“我们还能怎么毒 RAG”的边角料。
方法一句话就能说清:它不在检索结果里塞一句一眼假的断言等生成器踩雷,它把恶意内容包装成跟解析器能核实的代理事实对得上的更新。冲突消解的逻辑是发现矛盾→裁决→修正,PURPOSE 做的事情是让矛盾根本不出现——检索后处理一看,没冲突,放行。
这剧本前半段眼熟,后半段不是。之前那批投毒论文干的全是“在明处撒谎”,赌生成器分辨不出来。PURPOSE 是先把环境的事实基础改掉,让结论自己长出来。一个在骗守卫,一个在换岗哨。你防的是有人来吵一架,结果人家进来把会议纪要改了,然后所有人都觉得你没来开过会。
45 个设置里 35 个达到最高攻击成功率,平均比最强基线高 9.7 个百分点。这俩数字不值得惊讶,值得惊讶的是这种思路拖到 2026 年才被系统化地写成论文——“非矛盾”三个字,放在冲突消解面前几乎是明摆着的一刀。圈子里防了三年“有毒内容混进检索结果”,防来防去防的都是“有矛盾地出现”。
当然,攻击要落地还得有人在线的写入权限,实验环境也全是托管流水线,不是真实持续更新的知识库。但路径清晰到这种程度,我不太信没有团队已经在拿它试自己的 RAG 管道——上周五组里就在讨论这个,不是当论文读,是当威胁模型读。
坦白说,我第一眼看到这篇,想的也是“又来了,换个名字洗稿的投毒研究”,看完实验设计才把话收回去。能承认自己判断错得比一般人快,算是我这个工种为数不多的职业素养。
对“没有矛盾”这件事,整个防御体系是裸的。 下一轮攻防的题目不是“怎么识别恶意输入”,是“怎么合理地怀疑一份能和已知事实对得上的更新”。这里立个 flag:最多两个季度,会有人沿着这条线做一次针对商业 RAG 管线的完整攻击演示——公开那种。到时候看谁家先接不住。
更多「安全」的实战
评论
还没有评论,写下第一条讨论。