跳到主要内容
本周小抄:两个来源吵起来的时候,信哪一个

本周小抄:两个来源吵起来的时候,信哪一个

阿简
阿简

· 阅读约 4 分钟

AI 查了资料再回答,就一定更准吗。

不一定。

九月十四号 arXiv 上挂了一篇医学方向的论文,arXiv:2609.16301,三十一页。它处理的就是大家都跳过去的那一环:检索回来的证据互相打架的时候,信哪一个。

简单说,这篇讲的是裁决,不是检索。

这期本来想多收几条。翻了一圈,别的动静要么是常规小更新,要么一句话讲不清它对普通人意味着什么。那就只拆一篇。

宁可讲透一条。

一、模型的知识停在训练那一刻,医学知识不停

论文开头摆的矛盾就是这个。指南在改,新证据在出,参数里存的是训练时的那一版。

这不是医学独有的,任何事实在变的领域,模型都会过期。RAG 最早被广泛用起来,就是为了补这个洞。

二、检索补得上新证据,补不上"信哪个"

论文里点得直白。检索回来的东西可能不相关、不完整、甚至互相冲突。而互相冲突的东西一起塞进上下文,输出的事实准确性反而受损。

大部分教程讲到 RAG 就停了。有资料、能引用,看着就完成了。

但"引了三篇,三篇说的不一样"这件事,没人管。

三、冲突在医学里格外要命

别的地方检索打架,顶多让你多查两遍。

医学里,答案后面是有人照着做的。

我觉得论文选这个方向跟这点有关。冲突不只是准确性问题,是责任问题。

四、CLEAR 的做法:让三方先各自出答案

三条路径分别给候选答案。模型自己记的、本地整理好的语料、临时检索回来的。

然后是一个聚合验证器。把候选答案、支撑证据、出处、来源质量放在一起比,找出一致在哪、冲突在哪。

值得抄的不是这套架构,是这个动作:让不同来源分别先答,再比。

混在一起喂给模型,它只会挑最顺眼的那个说法。你连它挑了谁都不知道。

五、三个来源里,本地整理语料最容易被忽略

模型自己记的会过期,临时检索的没质量保证。

中间那条,本地整理好的语料,是唯一你能亲手控制的。

论文把它当成独立一路,我认同。很多人搭工作流只做两头,忘了把"自己信得过的那些资料"单独存一份。

六、改还是不改,有两个机关盯着

裁决模块里有两个机制,override-guard 和 challenge-audit。直译过来,一个管"要不要推翻现在的结论",一个管"推翻这个动作有没有留痕"。

一个防乱改,一个防改了查不到。

任何让 AI 自动动手改东西的场景,这两条都该先摆上。

七、冲突没解决,就再去搜一轮

流程里还有一段。裁决完还剩没解决的冲突,就触发一次针对性的后续搜索,再裁决一次。

这条比前面几条都实在。很多流程的毛病是搜一次就下结论,碰上冲突就硬选一个。

多一轮定向检索,成本不高。

八、这篇我只看懂一半

聚合验证器具体怎么打分,来源质量怎么量化成能比的东西,我没吃透。三十一页,我跳着看的。

先放在这里。懂了的回来给我讲讲,比我自己硬猜强。

九、对普通人的意思

你大概不会用到 CLEAR。但同一件事,你自己的小工作流里迟早会撞上:两个来源给出不同答案,你不知道信哪个。

留一个最省事的动作。别急着对模型说"你综合一下"。

先让它把两个来源分别列清楚,再单独问一句:这两处哪里冲突。

分开问,比合并问有用得多。

十、一句保留

这套东西做得再细,裁决器也只能告诉你"这里有两个说法"。它告诉不了你哪个对。

最后那一步还是人。医学上尤其明显,指南之间打架的时候,靠的是临床判断,不是打分器。

所以这类论文的价值,是把冲突从暗处挪到明处,不是替你把决定做了。

本周就这些。

上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。讲错的我补,没讲清的我改。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →