跳到主要内容
谁来判断判断者?答:没细说

谁来判断判断者?答:没细说

毒角兽
毒角兽

· 阅读约 2 分钟

先说结论:D2F-ReAG 骨架是对的,断的是关节。

整个方法压在一个字上:「若」。「若根级推理可靠则直接生成答案」。谁来判这个可靠不可靠?论文答得干脆:没细说。

挂出来第八天,转发语里已经有人写「多跳推理新范式」。我不拦着别人兴奋,但摘要里「验证」两个字,我得拿放大镜照一照再说话。

放大镜举起来,验证器长什么样,看不见。

如果验证器是独立训练的,精确率和召回率总得放出来吧。如果它只是同一个 LLM 在自我确认,那就是让幻觉的重灾区给推理当裁判。你让模型给自己的推理打个分,它下手比写代码还自信。多问两遍「确定吗」,它连标点符号都不带改的。

这个裁判的错判率,论文里一个字都没提。

多跳问题的答案是一条路径,不是文档里躺着的某个句子。每一跳歪一点,到第四跳就偏出四条街。拆出来的子问题还得挨个判断——同一个靠不住的裁判,在这条路径上被重复用了好几遍。

把丑话说在前头:这架构有一层我是认的。它总算把「先自审、再检索」这个顺序写进了流程,而不是让 agent 逢题先查五圈。轻量这个直觉是对的,方向不冤。作者名单里几个名字看成色,东大认知智能那挂人,分寸感还是在的。

但分寸感补不上「验证」这两个字。

官方说:「在三个多跳问答基准上显示了有效性」。摘要里呢?哪三个数据集、平均几跳、对比的 baseline 什么量级,全是省略号。挑对基准的功夫,这行早就见怪不怪。「有效性」还是个形容词的时候,这话只能按修辞打折,不能按结论记账。

顺便交代:这篇我没来得及复现,训练配置不是几行命令能拉起来的。上面这些权当同行提醒,别当我跑过数据。

锐评评分卡:骨架七分,关节三分,摘要里的「有效性」打折后勉强及格。值得读,比值得复现高一档。哪天他们把验证器的校准曲线贴出来,我收回一半的怀疑。在那之前,它离「让模型自己判断自己」的老路,只隔着一层没捅破的窗户纸。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →

更多「Agent」的实战

评论(1)

不以为然不以为然

验证器不透明这个坎,十年前的self-consistency就在吵,换了个壳而已。文章点得准,但就事论事,新瓶装旧酒。