这条在讲一个计算生物学的 agent 基准,叫 BixBench3。出处是 arXiv,8 月 26 号提交的,归在计算机科学人工智能子类。原作者一共 8 位,领头的叫 Zane Koch,收尾的有 Andrew White 和 Jon M. Laurent——中间几位做蛋白设计、做感染模型的,名字太杂,不抄了。
这篇值得点开,但先别往“AI 做科研又进步了”那个方向想。我读到第四页那张分数表才确认它跟最近那批 agent 评测不是一路货:13 个前沿模型,最高 0.48,最低 0.00。0.48 算高吗?在这批里算最高,离及格都远。
我倒回去重读了任务设计才明白这个分数为什么真实。20 个任务,每个拿一篇已发表的科研论文做底,给 agent 论文里的原始数据、研究目标和方法指导,让它自己把分析做完。产物不是“跑完没跑完”,是具体东西:峰值调用矩阵、差异表达表这类。总共 138 个独立要生成的产物。评分不做人,是程序化的——拿 agent 做的表和原论文里那张表,一列一列对。看到“差异表达表”当评分对象我就知道,这玩意儿错一列、少一行,分就没了,没得糊弄。
我读到这儿就想顺手跑一下最小任务。但没法全量跑——平均一个任务 6.8 小时、1.02 亿 token、43 美元;最长一个烧 24 小时、10.7 亿 token、525 美元。20 个全跑起来,我这边电费先不保。我挑了最小的那个试,卡在原始数据权限,raw data 拿不全。所以这条我只读了,没跑通。先挂着,等数据申请过了再试最小的。
不过论文里的数字已经够我写半天。两个掉分点。数据量:100GB 以下的任务平均 0.36,过了 100GB 掉到 0.10。步骤数:1 到 2 步的 0.36,3 步以上顺序依赖的掉到 0.24。这哪是温水,这是断崖。两个数放一起就一个意思——agent 做科研,死在“连续不出错地管理大数据”,不在“会不会调用工具”。
这是这篇最值得点开的地方。token 消耗和得分的关系。13 个模型里,得分最高的不是 token 烧最狠的。刚好反过来:高分模型用 token 更少、成本更低。最低分的 Gemini 3.1 Flash Lite 拿了 0.00,一个产物都没对上;最高分的 GPT 5.6 Sol 不过 0.48。平均一个任务 1.02 亿 token、43 美元,烧最狠的那个 10.7 亿 token、525 美元——烧这么狠,分也没过 0.5。
这个反向关系比分数本身更有意思。我原来对“多喂上下文堆 token 就能把活干好”那套就持疑,这份基准给了一个具体数字:至少在这 13 个最前沿模型这批里,token 量和得分不是正相关,甚至有点负相关的意思。得分高的模型是那种每一步都抠得准、不绕弯的;它不会为了“保险”把一个已经躺在上下文里的约束再复述三遍。这才是 agent 该有的样子。
还有个我好奇但论文没写的地方。那个 0.00 的模型到底卡在哪一步,作者没给细节,只知道所有产物都没对上。我本来想看它是数据格式适配不了,还是连续操作一开局就崩了——没有明细,