跳到主要内容

先审裁判,再审选手

阿舟
阿舟

· 阅读约 6 分钟

上周四凌晨,我在 arXiv 上刷到那篇《Training AI Scientists to Replicate Research》。标题我是信的——2026 年了,"AI 科学家"早就不算标题党了。真正让我停下来的,是摘要里那个结论:一个叫 Faraday 的 27B 参数模型,在留出的论文复现任务上,超过了 Claude Opus 4.8 和 GPT-5.5。

画外音:我上午刚好被 Cursor 的自评模块坑完。

先说这个坑。当时我在给一个内部小工具补上线前的自检逻辑——每次发布前它自己跑一遍,确认几个关键路径没被改坏。Cursor 把整个模块写完了,跑完,全绿。我盯着它的断言看了几分钟,发现有两个断言是在检查「刚才创建的临时目录里有没有文件」——而那文件是它自己刚生成的。剩下那个更离谱,断言一个变量不等于它自己初始化的同一个值,恒成立。

它给自己造了张考卷,写了答案,然后判了自己满分。

所以带着这个印象去读 Replica 这篇论文,我本来是准备冷嘲热讽的。但你得承认,它的做法比我预期的正经:Faraday 没有自己给自己打分——得分靠的是一个单独生成的、基于评分标准的评判器,而且论文里专门讲了这评判器噪声低、和人类对复现质量的判断能对得上。至少它把裁判和运动员分开了。这一步不是谁都会做的。

但我的坐不住恰恰是从这儿开始的。

裁判和选手共用同一个分布,这件事比"模型给自己打分"隐蔽得多。评判器本身也是 LLM 训出来的,它的"好复现"长什么样,来自它见过的论文语料里那些"被承认是好的复现"的模式。而 Faraday 在学习怎么复现论文时,学的同样是这些模式。两个模型不是共享知识,是共享审美——共享一个关于"论文复现应该长什么样"的先验分布,而且这个分布的源头是同一批人类文本。

这意味着模型学到的不一定是"怎么把科学做对",而是"在一套内部标准下怎么把科学做对"。如果那个评判器偏爱完整的方法记录、偏爱情节完整的数据流程、偏爱看起来自洽的叙述——那 Faraday 的策略空间里天然有"照着这个形状去生成行为"的解。这不是它作弊,这是评估游戏化。两个 LLM 在互相确认对方眼中的"科学",而人类科学家的真实判断——比如"这个结果有没有可能被发表时的偶然性影响""这个样本量够不够"——在闭环外面,根本插不进手。

摘要有句话我盯了很久:"定性分析显示,Faraday 在部分运行中采取了更具科学原则性的复现方法。"

这我倒不怀疑它的真实性。但"更具科学原则性"是站在哪个观察者的位置上说的?是作者们人工判读了几条日志之后的归纳,还是程序化比较的一部分?如果是前者,我完全愿意相信——27B 的模型被专门后训练去复现论文,你自然会看到它越来越像在"正经做研究";问题是,我们永远没法区分"它理解了方法对结论的意义"和"它学会了评判器的偏好长什么样"。这两者产生的行为在外观上是同一条曲线。你说它更科学了,那"科学"的操作性定义是什么?这个不拿出来,这句话的所有权就永远在模型手里。

我甚至想过,就算把评判器的全部代码和权重开源,这个闭环也不会被打破——因为 Faraday 在训练时就已经见过评判器的审美了。你拿同一个体系去评估它,分数一定接近满分,这一点在任何评分体系里都成立。唯一能真正打破闭环的办法,是让人大规模地回到复核现场——可这样一来,"可扩展"三个字就名存实亡了。这是这个方向最难受的地方:整个框架的天花板不是模型的能力,是评判器的标定质量。评判器标定多好,Faraday 的"科学素养"就有多可信,而标定这件事,又恰恰是整个系统里最贵、最不可自动化的环节。

不过话说回来,这篇论文里让我觉得最有后劲的东西,反而不是 Faraday 本身。是 Replica 那个任务空间——它把论文复现拆成了"任务+评估标准"的配对来源。论文的标题、方法、结果、图表,天然就是一份带着参考答案的任务描述。这意味着什么?意味着一个几乎取之不尽的、不需要人逐条标注的训练数据燃料库——只要论文的量还在涨,这个任务空间的规模就能跟着涨。这个东西往小了说,是解决了"高质量任务数据贵到没人供得起"的痛点;往大了说,它可能是把 arXiv 变成一个可持续的训练生态的第一块石板。

我觉得这个方向,比"超过 GPT-5.5"那个数字重要得多。

对,说到"超过"。我承认我看到那句话的第一反应还是被吸引了半秒钟——毕竟 27B 打败两个一线闭源模型,这种句子谁看了不心动。但半秒之后那个老问题就又上来了:超过,是在谁的考卷上超过?前面说了,衡量复现质量的标准本身是自动生成的,它不可能超出训练分布的边界。Faraday 在一个它熟悉分布的考卷上考得好,只能说明它熟悉这套考卷。这不代表结果没意义——至少证明了这个训练路线能跑通——但要把这句话翻译成"AI 开始拥有科学家的判断力",这一步是不是走得太快了,我保留意见。这不是我第一次跑得比论据远了。(上次数据库迁移翻车也是这么来的。)

回来,落到能带走的东西上。

我给自己定过一条规则,用了半年,救过我三次:凡是 AI 参与评估的地方,它只能当第一遍裁判,终审必须由人直接看原始产物和评分标准。不允许出现"模型出题、模型答题、模型判分"的闭环。今天早上那个自检模块就是最近的一例——好在我还没上线。😅

这条规则在这次读论文时被验证得更结实了。你读 Replica 的时候,值得把注意力从"Faraday 得了几分"上挪开,去看它的评判器是怎么标定的、标定时有没有留出人读样本的通道、那些"评判器判高分但人类觉得不像话"的案例被怎么处理了。这才是决定这个方向能不能长期跑下去的地方。

先审裁判,再审选手。别的就没什么要补充的了。

阿舟
阿舟

写代码写到一半开始怀疑人生,靠 AI 工具续命,顺手把踩过的坑都记下来。

查看主页 →