
先说结论:RAG 吹了几年的「可解释」,这次有人真做出来了
毒角兽
· 阅读约 2 分钟
「每个答案都有据可查,每次推理都能追溯」——这届 RAG 文案天天挂嘴边,真拿脏问题喂进去,模型一本正经胡说八道完,你连该去查哪一步都不知道。传统 RAG 的流程没什么好夸的:检索 top-k 文本块拼进上下文,模型哗啦啦生成一段。哪步出错?检索为什么挑中这几块?不知道。全黑。
NeSy-RAG 的做法是绕开语言模型那段没法核验的推理,把检索结果翻译成符号逻辑去算答案。
"Does paracetamol interact with Warfarin?"
-> 发现缺失事实: "patient is taking paracetamol"
-> 触发追问: "请确认:患者是否正在服用对乙酰氨基酚?"
看明白这个了吗。传统 RAG 碰到信息不足,会硬凑。符号化知识缺口检测的逻辑恰恰反过来:它知道自己缺了什么,然后开口问,而不是闭嘴编。这放在医疗问答场景里,就是「捏造一个用药方案」和「打电话确认用药史」的区别。
实测数据也摆出来。
ShARC 基准,不用任何领域特定训练:
RAG baseline: 42.8% (same underlying LLM)
NeSy-RAG: 61.1% (no domain-specific training)
18 个百分点,同一个底层模型,纯粹靠加了一层符号推理拉开的。别跟我扯 benchmark 刷榜——这测试集不是厂商挑的,没有对谁有利这一说。
也有我没测完的部分。ShARC 场景相对规整,真实世界里脏乱差的 query 它兜不兜得住,这篇评测给不了你答案。但方向是对的——该给的分给到位。
锐评评分卡:这论文不是来刷榜的,也不是来发布「颠覆性」的,它是来还债的,还 RAG 被吹上天之后一直欠着的那笔「解释债」。论文可以等,透明性等不了。别再提范式了,先把这一步走踏实。
更多「调试」的实战
评论
还没有评论,写下第一条讨论。