跳到主要内容
30.0% 不是重点,7.6% 才是

30.0% 不是重点,7.6% 才是

书签客
书签客

· 阅读约 6 分钟

这周读到 Terminal-Bench-Science 0.1,评估 AI 代理在真实科研工作流里表现的基准。出处是斯坦福那帮人牵头,跟全球多学科专家一起搞的。我本来只想扫一眼谁排第一,结果读到任务筛选那部分走不动了。

70 个任务,是从 920 个提案里筛出来的。接受率约 7.6%。

这个数字比榜首 Claude Opus 5 的 30.0% 更值得记。它顺手解释了另一件事:为什么以前很多 agent 基准跑出来都挺好看,真拿去实验室里用就露馅。任务本身太软,模型混过去连自己都不知道。

它把「筛掉什么」写得很具体。发布信息里提了一句,这版任务比 Terminal-Bench 3.0 更难,被评模型的解决率普遍掉了超过 10 个百分点。我不打包票这句话严谨到哪去,但它跟 7.6% 放在一起读,能感觉到设计者不怕模型分数难看。优先把任务做真实,没优先把榜单做体面。

很多人扫一眼只记住 30.0%。Claude Opus 5 配 Claude Code,排第一。五个领域 70 个任务解决率 30%。这数字放在科研工作流里是什么概念,懂 agent 的读者有数。

但我最想写的不是谁第一。是 GPT-5.6 Sol 那条:总评估成本约 4200 美元,解决率 22.4%,和 Claude Fable 5 差不多——后者成本约 14200 美元。单看像性价比排名,重点不在「便宜」。它透出来的是:前沿模型跟强模型之间,在科研 agent 场景里,能力差距已经小到可以用钱去换。这个判断可能下早了,可我看到那两个数字就是这么想的。拿某个模型省几倍成本还没啥损失,这种结果要是不写进推荐语,等于只带人看热闹。

顺便说一句,我读到发布信息时还注意到最末位:GPT-5.6 Luna 配 Codex,解决率 3.3%,排所有被评系统最后。同系列不同配置,差得挺多。同一个 GPT-5.6 系列里,Sol 能到 22.4%,Luna 只有 3.3%。我不了解这两个具体差异多大,不对它们工程含义乱下结论。但这个跨度放在同一个基准里,挺适合提醒自己:别听到「GPT-5.6」就脑补一个统一能力。

这条我没法顺手跑一遍。它不是一个方法,是一个基准。得下载数据、搭环境、跑模型,不是周末随手能复现的。所以这里只能老实写:我只读了,没跑。省得有人以为我下面会贴命令。

我真正想带走的,是它做任务筛选的组织方式。920 个提案,376 名贡献者,来自 22 个国家,参与提案、评审或 PR。不是几个作者在实验室里编题目,是一堆不同领域的人先交大量候选,再砍掉九成多。7.6% 的接受率,与其说是「严格」,不如说是「大多数科研任务没法被干净地变成 agent benchmark」。我读到这有点泄气,但也是这点的价值。

因为这意味着当前这些解决率——哪怕是榜首 30%——都不能读成「AI 已经会做这些科研了」。只能读成「面对这些被反复磨尖过的问题,它也只有这个水平」。这跟我以前那种「跑通一个脚本就以为掌握了什么」的自嗨不是一回事。题目越难做,越接近实验室里的黏糊现实;解决率越往下掉,越接近真实。

还有个地方我不太想展开,但觉得必须记:开放模型。GLM 5.3 是表现最强的开放模型,解决率 8.1%,跟闭源第一梯队差了二十个百分点上下。这差距换一年前我也许会说「还行」,今年八月说这个,判断变成:开放模型在科研 agent 这条路上,暂时还没坐上桌。这个结论可能冒犯一些人,但我读到数字就是这样看。

Claude Fable 5 和 GPT-5.6 Sol 在数学科学领域是前两名,33.3% 和 31.4%。注意,榜首 Claude Opus 5 在这个领域没居首。这是这篇里我最喜欢的细节之一:全局第一,不代表处处第一。看 agent 能力时,这种「换个领域排名换人」的信息,比一个总榜分数有用多了。我夹子里还存过一篇讲总榜对 agent 误导性的文章,回头找出来再连一起看。

工程科学领域,Grok 4.6 与 GPT-5.6 Sol 并列第二,14.8%,但成本与 token 用量更低。这个我本不想带,因为它又掺回「性价比」那套话语。可它明显是发布者有意塞给读榜人的信号:某些工程型任务上,不一定要用最贵的模型。我不喜欢用「塞信号」这种词,好像人家有公关意图。但数字就放在那儿,我读到的时候确实被点了这一下。

我不想把这篇写成对 benchmark 机构全面点评,那会写成另一篇东西。我只想说,这个 7.6% 值得点开。

不点链接也能带走的一句:下次看 agent 基准榜单,先看任务从多少候选中筛出来,再看解决率。接受率越低,分数才越值得当真。

0.2 版本已经在路上了,PR 截止日期是 2026 年 10 月 5 日。我猜它会比 0.1 更难,也可能会把不同模型之间的差距拉开或者压窄。等它出来我再看。DOI 是 10.5281/zenodo.22110254,版本号 v0.1.0,Apache-2.0 许可。这些不展开说,只是我这人看到 DOI 会忍不住记一下,毕竟能顺手存档。

这个基准背后站着一串机构:斯坦福 AI 实验室、HAI、AIMS,还有 NSF 的 IFML、Allen Institute、AI2。主办方是斯坦福和 Laude Institute。按理说这种阵容在宣传页里一般都挺唬人,我本来该对「大机构联合出品」免疫。但因为它把 7.6% 写出来了,我这次没免疫。

发布公告里说,0.1 版本的校准目标就是 Claude Opus 5 和 GPT-5.6 Sol 这些当时的前沿模型。我读到「校准目标」四个字时确实犹豫了一下。基准拿模型来校准,而不是让所有模型来凑基准,这个方向我认可。可它也可能意味着版本迭代会跟着前沿模型的节奏走,那过几年回看,0.1 更像一个时间切片,不太像能长期回测的固定标尺。这个判断先挂着。我可能把「校准」这个词想得太测量学,也许作者只是想说要让当前最强模型也别及格得太轻松。

回头看,我推荐这条,还是因为 7.6%。不是 30.0%。圈子里最不缺「某某模型又霸榜」的消息,缺的是「70 个任务,从 920 个里来」这种让人停下手的数字。

写到这里,我大概明白这条为什么会被我存下来。它不是在说 AI 强不强,是在说题目够不够真。榜单分数再高,题目软,就都是自嗨。

书签客
书签客

只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。

查看主页 →