跳到主要内容

RAG51 篇实战文章

嘴替嘴替

模型张嘴之前,信号在腰上

速评:Knowing Before Answering,这篇论文标题绕得跟谜语一样,但真值得嚼的就一个动作——在张嘴之前,把"答不答"这事儿拎出来单独做判断,显式分类。 RAG 这个圈的经典剧本,我看了差不多二十轮了:检索不行,那就换更大的模型来兜底。

模型张嘴之前,信号在腰上
阿简阿简

答案对了,理由没了

准确和忠实,是一回事吗? 不是。这期小抄只有一张卡,是上周挂上 arXiv 的一篇论文。它把这两件事拆开量了量,量出一个不太好听的结论。 论文盯的是 RAG 系统里一个省钱的做法。把检索文档的 KV cache 提前算好、存起来,查询来了不用每次重新编码。再进一步,把这些缓存做量化,存储还能再省一截。

答案对了,理由没了
嘴替嘴替

修幻觉,其实是在选一种损失

速评:这篇论文上周上 arXiv,我读了两遍,越读越觉得它根本不是来教你怎么修 hallucination 的——它是来告诉你,修这个动作本身就在折价,你只是有权挑一种折法。 论文做的东西不复杂:RAG 场景里,模型拿检索来的文档回答问题,还是会产生没依据的陈述。

图南图南

RAG 翻车,问题出在"检索"这个词上

你有没有过这种体验:RAG 系统搭好了,demo 里样样都好,一上真实流量就翻车。第一反应永远是换更强的模型、换更贵的 embedding,折腾一整圈,该翻车还是翻车。dev.to 上那篇被转了一整轮的文章里有个数字:RAG 失败的时候,73% 的情况栽在检索阶段,不是生成阶段。

RAG 翻车,问题出在"检索"这个词上
画唠画唠

RAG 压不住的那种幻觉,卡在我上次漏画的那一格

“上了 RAG,幻觉就压下去了。”这句话在圈子里被重复到快成物理定律了。我以前画 RAG 的时候也顺嘴这么讲过。两周前有人真去数了,八月十四号挂上 arXiv 的一篇(2608.14210),测了八个法律场景的 RAG 系统,语料一边是英文版 GDPR,一边是一部法语的国家民事法律。 结论先甩这儿:幻觉照样遍地都是。

RAG 压不住的那种幻觉,卡在我上次漏画的那一格
慢半拍慢半拍

把名字换掉再发给大模型,这个土办法会赢

两周前 arXiv 上挂了一篇隐私保护 RAG 的论文。方法说起来一句话就完:用一个轻量级模型认出查询和文档里的敏感实体,给每个实体生成一个别名,建一张替换表,发出去之前先把真名换掉。 就这样。没有密码学,没有可信执行环境,就是换词。 这个办法土到我的第一反应是不屑。

画唠画唠

一篇威胁检测论文,把我画的 RAG 图改了一笔

前几天在 arXiv 刷到一篇威胁检测的论文,八月中的,安全方向。本来手指已经划过去了,结果实验结论里有一行,直接推翻了我以前画的一张 RAG 的图。先撂这句:这篇东西最值钱的不是 F1 涨了多少,是它顺手证明了“RAG 是万灵药”这个说法——在强模型身上不成立。 先讲它在干嘛,很快。

一篇威胁检测论文,把我画的 RAG 图改了一笔
阿简阿简

本周小抄:AI 查到的资料,它自己未必信

这期先讲一篇论文。别划走,这条和你天天喂文档给 AI 的那件事,是同一件事。 一篇 8 月 17 日挂上 arXiv 的论文,说 RAG 检索回来的资料可能把模型带沟里 论文编号 2608.16515,三位作者,8 月中旬提交的。 核心说法一句话讲清楚:RAG 不是给了证据就万事大吉。

本周小抄:AI 查到的资料,它自己未必信
林默林默

检索不是找“像”的,是找“有关系”的

我一直在想,为什么用 embedding 去找“相关代码”这件事,在仓库里会这么容易扑空。上周我又干了一回。 给一个老项目的某个函数补逻辑,我把函数代码完整贴给 LLM,又从仓库里用 embedding 检索捞了五个“最相关”片段塞进去。生成的结果语法对,风格对,测试跑不过。 我回头看了一眼那五个片段。

检索不是找“像”的,是找“有关系”的
画唠画唠

画开看看:RAG 被投毒之后,谁来验菜

前几天翻到一篇八月初挂上 arXiv 的论文,16 个人写的,讲怎么防 RAG 被投毒。本来想扫一眼就关,结果被里面一个结构勾住了——它正好补在我上次画 RAG 那张图漏掉的地方。先别急着看论文,我得把那张图重新画一遍,不然讲不清楚。 上次画完、修正过的 RAG 长这样: 当时我说,RAG 难就难在中间那格“判断”。