“上了 RAG,幻觉就压下去了。”这句话在圈子里被重复到快成物理定律了。我以前画 RAG 的时候也顺嘴这么讲过。两周前有人真去数了,八月十四号挂上 arXiv 的一篇(2608.14210),测了八个法律场景的 RAG 系统,语料一边是英文版 GDPR,一边是一部法语的国家民事法律。
结论先甩这儿:幻觉照样遍地都是。最好的系统,不到 10% 的回答有幻觉。最差的那个,接近一半。
我盯着“接近一半”看了半天。数了三遍。没错,接近一半的回答在编。
(“不到 10%”那边也先别急着鼓掌。法律场景里十条意见一条是编的,这东西你敢署名往外发吗。)
先把我上次画的图搬出来。上次画 RAG,我第一版就漏过一格,动手挨了打才补上,最终版长这样:
你提问 ──► 查资料 ──► 模型判断"这段相不相关 / 够不够" ──► 用上 / 丢掉 ──► 回答
中间那格“判断”,是我画错一次才加上的。这篇论文干的事,差不多就是拿八个真实系统给这张图做压力测试——而且测得比我狠:不光按整条回答算,还下到单条断言那一层,算了幻觉的密度和严重程度,最后又拿法律专家手写的 142 道题重新验了一遍。
等等等等,先别急着去骂那个接近一半的系统。这篇里最扎我的不是百分比,是另一条:前提就错了的问题,幻觉率特别高。
什么叫前提就错了的问题。打个比方,你问它:“GDPR 第 150 条对数据处理者有什么要求?”,GDPR 一共 99 条,150 是我现编的。正确答案只有一句:“没这条。”但这种题进了 RAG 系统,遭遇大概是这样:
"根据第 150 条……"
│
▼
查:检索器不会找"不存在的条文",
它只返回"最像的"几段 —— 而总能找到像的
│
▼
拼:桌上有材料了
│
▼
答:一本正经给你讲"第 150 条"的立法精神
看到问题在哪了吗。整条流水线里,没有任何一格的职责是“检查问题本身成不成立”。检索器是相似度机器,你问什么它找什么,问一条不存在的条文,它照样端回来几段最像的;模型是接龙机器,桌上有料它就敢接。两台机器都很称职,串起来就是一场事故。
我盯着 false-premise 这个词看了半天,咔哒一下扣上了 💡——RAG 压不住的幻觉,大头根本不是“查不到”,是“不敢对问题本身说不”。我上次那格“判断”画小了:它不光要判断“查回来的资料相不相关”,还得先判断“这个问题站不站得住”。前者是资料问题,后者是胆量问题,而流水线里没人负责胆量。
再打个比方,RAG 一直被讲成开卷考试:答案都摊在桌上了,还怕答错?这篇论文告诉你,开卷了,最差的还是一半回答在编。
这个比喻有两个地方漏风,老实标出来。一,考卷上的题是出题人校过前提的,真实用户的问题里混着大量前提就错的题,开卷考试没这种题型,真实世界全是这种题型。二,开卷考生翻到不沾边的页,多少会心虚;接龙机不心虚,检索
