准确和忠实,是一回事吗?
不是。这期小抄只有一张卡,是上周挂上 arXiv 的一篇论文。它把这两件事拆开量了量,量出一个不太好听的结论。
论文盯的是 RAG 系统里一个省钱的做法。把检索文档的 KV cache 提前算好、存起来,查询来了不用每次重新编码。再进一步,把这些缓存做量化,存储还能再省一截。量化这个词之前收过一次,可以理解为用更粗的刻度存数字,省地方,代价是精度。
省下来的钱,代价记在哪个账上,这是论文要查的事。
他们量了两样东西。一样是准确性,答案对不对。另一样是忠实性,答案是不是从你给它的材料里推出来的。
白话版可以这么看。模型像个交卷的学生。准确性看答案,忠实性看过程是不是从卷面给的条件推的。答案碰巧对了、过程跟条件对不上,这就是准确性还在、忠实性先走了。
实验不复杂。模型用 Qwen2.5-7B-Instruct,数据集是 RGB 和 HotpotQA,量化试了 INT8 和 INT4 两档。量忠实性的尺子搭了三把:幻觉检测器、自然语言推理的蕴含判断,再加一个 LLM 当裁判。让模型审模型这件事本身就挺值得聊,够单独一期,先不展开。
作者是 Atta Ul Asad 几位,编号 2608.30996,想读的自己去搜。
结果分两半。
INT8 基本没事,准确性和忠实性都接近无损。想省钱的,这一档可以抄。
INT4 是另一回事。准确性掉了,这个在意料之内。要紧的是后面那个:在仍然事实正确的回答里,忠实性的变化超过九成是往坏的方向去的。
超过九成。这个数字我第一眼不信,回去翻了一遍才确认自己没看错。
可以理解为,答案还是对的,但支持答案的那条线已经断了。它现在靠自己的记忆和惯性在答题,不是靠你递过去的那份材料。材料可能已经不在它的决策里了。
这种坏法最阴的地方是看不见。拿准确率去验收,指标全绿。绿灯底下,忠实性已经空了。
大多数人验收 AI 产出的方式,本来就看结果。代码能跑就收,答案对了就交。这篇论文等于指着这套流程说,只验这一样,验不出全部的坏。
补充一句,论文还发现:检索结果越脏、塞进去的块越多,忠实性掉得越狠。
这条值得单独说。多塞点材料总没错,是很多人的默认动作,我自己也这样。现在有数据讲,材料一多,压缩的副作用会被放大。
作者给的建议很直接。压缩过的缓存上线之前,先审计忠实性。翻译一下,省钱之前先查账,查的不是余额,是对不对得上账。
写到这里,本来想把 INT4 为什么坏得这么偏也一起讲掉。老实说,机制那部分我只吃透了一半。先放在这里,懂了再补。
留给普通人的部分。
你不做 RAG 部署,这篇的操作大概率用不上。但准确和忠实这个区分,日常验收 AI 的东西时能直接抄。
- 别只问答案对不对,问它是从哪一条得出的。
- 让它把理由用自己的话讲一遍。讲不出来的对,和蒙对没有区别。
- 这次理由断掉但答案碰巧对的,下次就是幻觉。忠实性是幻觉的前置指标。
代码那边同理。AI 写的能跑,和你能说清它为什么这么写,也是两件事。能跑就裸交,等于只验收了准确性。这个说法我之前收过一次,这回算是有了正式出处。
本期只有一条,不是没别的可收,是这一条值得单独讲穿。六张卡每张两句,不如一件真的事讲到底。
本周就这些。
有觉得我讲错的,或者上面那半截机制你读懂了、愿意回来讲讲的,都欢迎。
下周见。
