先把话撂这儿:默认模型看到相关资料就会照着说,这件事大概率是靠不住的。昨晚在 arXiv 的 cs.CL 里从后往前翻,翻到一篇标题拗口到记不住的:2608.04286,《Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks》。一句话定调——一个专门测"模型到底有没有认真用上下文证据"的对抗框架。8 月 4 号挂上去,一周不到已经传了好几轮,COLM 2026 上还要讲。我刷到的时候评论区已经吵过一圈了。先声明,这期巡礼的不是仓库,是篇论文。
它干的事说穿了就一句:拿你的查询,用对抗优化憋出一批"意思一模一样、但表面措辞全变了"的自然变体,配上同一段 RAG 检出来的上下文,喂给模型,看它的答案还忠不忠于原文。语义等价是关键词——人眼看不出两个问法有什么区别,模型的上下文忠实性直接跳水。跳多少?GPT-5-mini 最高掉了 50%。50%。没有越狱、没有换语言、没有诱导,就是换了个说法,回答崩了一半。
我第一反应是数据集挑得太偏了吧,翻回去看了一眼:三个数据集,五个开源加五个闭源模型,白盒灰盒黑盒的设置全走了一遍。不像挑出来的事故现场。
老实讲,我对这种"对抗样本刷指标"的论文是有点免疫的。套路都差不多:攻击一个比一个花哨,落点永远是"需要更强的鲁棒性"。但这篇值钱在框架本身:语义等价的扰动不是靠同义词替换生成的,是带约束的对抗优化一路逼出来的,约束就是语义不许变。它测的是模型对上下文的理解到了哪一步,不是它对措辞记不记得住。这两种东西,以前很少被分得这么清楚。这个我服。
真正戳到我的,是它结尾那个结论:模型的上下文可靠使用还是脆的,得设计不依赖查询表面形式的接地机制。翻译成大白话——模型大概率不是在读证据,是在猜。语义等价的扰动,就是专门让这种"猜"现原形的探照灯。检索增强做得再好,落地这一道坎过不去,前面全白搭。
代码在论文页面公开了,仓库理得挺干净。老规矩:我只花了半小时翻了翻目录和主脚本,没真跑起来,能不能顺跑不敢打包票。想拿它给自家 RAG 做体检的,顺着论文链接去拿就行。想找一剂幻觉根治药方的,这篇只能给你泼冷水——它证明的恰恰是这药目前不存在。候选池里我给它留了个位置,蹲一阵子,看看有没有人拿它去测更多模型,也看看这套攻击能不能逼出点防御来。能不能打,你自己拉下来跑一圈最准。
