先说结论:三天前挂上 arXiv 的 ProgramDistill,最值钱的不是榜首成功率,是「恢复深度从 1 加到 8」那一列。前一列谁都会剪进 PPT,后一列得你自己坐下来算。
论文讲的事不复杂。现在的编码智能体评测基本是喂一条 issue、一句指令,告诉你"要什么行为",然后看它写不写得出来。作者说这不对——真实网页开发里没人给你把行为写清楚,你得从能跑的东西里自己看出来,再往一个不完整的应用里补上。
这条我认。真实项目里最常发生的不是 agent 写错,是它写对了你没说的那件事。
他们做出来的东西叫 ProgramDistill。挖掘流程叫 mine-craft-patch,名字起得像某个沙盒游戏的 mod。做法是把应用拆成不同粒度的特征,每个特征对应一段能拿 gold patch 重放验证的行为,然后从 26 个应用里挖,全程不进人。
数字是这样:
26 个应用
→ 1,975 条重放验证过的行为
→ 4,063 个任务
摊下来一个应用七十多条行为。规模不算小,至少比凑两百条就开发布会的强。
官方给这张基准的定位是「难度可控、可扩展」。前半句我信,后半句得看谁用、怎么用。
全应用重建(累积工作流)
GPT-6 Astra 49.2%
Claude Opus 5 28.8%
部分重建,恢复深度 1 → 8
Astra 100% → 64.0%
Opus 5 96% → 32.0%
看第二张表。深度 1 的时候两个模型一个 100 一个 96,这个数没有任何信息量——深度 1 差不多就是照着参考应用抄一个特征回来,抄不对才叫新闻。真正的信息全在斜率上:深度爬到 8,Astra 掉 36 个点,Opus 5 掉 64 个点。
Opus 5 这波掉得不冤。三分之二的准确率是在同一条曲线上蒸发掉的,这不像随机波动。
九个前沿智能体参评,能被反复引用的就这两组。49.2 和 28.8 之间差着 20.4 个百分点,同一套任务、同一套阈值,差出一倍——我更愿意把它读成两个模型对"从运行中的软件反推行为"这件事的适配度不同,不是单纯谁强谁弱。换句话说,这张表测的不只是模型能力,还测了模型吃不吃这一口任务形式。
再说一个我不太满意的地方。「从可运行的软件里推断行为」——但参考应用是功能完整的。你要的那个特征就明明白白活在参考应用里,agent 是去找,不是去造。
找和造是两件事。真实项目里最要命的那类任务,是这条行为在任何现存软件里都不存在,你得先设计出来再实现,ProgramDistill 测不到。它测的是发现能力,标题里那个词比它实际测的范围大了一圈。🙃
但 mine-craft-patch 这个流程我给它加一分。无人工干预,每条行为都拿 gold patch 重放过,这个门槛比从 GitHub 上扒 PR 配 issue 的老办法高一截。后者验证的是"你能不能复现一个已经被人写出来的补丁",噪声大得离谱,我在这套玩法上吃过太多亏。
预期拉到最低结果被打脸,这次是往好的方向打脸。
还有一句论文里的话我觉得比所有跑分都实在:这套东西可以做未来的课程式训练基础。它自己承认了这条深度曲线是一条梯度,不是一次性的打分表——单点上谁高谁低意义有限,能顺着梯度爬多高才有意义。什么时候把这句话读懂了,什么时候就不会再拿某一次发布会的成功率当结论。
26 个应用具体是哪些类型、分布怎么样,我还没扒到能下判断的程度。这条先挂在这儿,别信我这半句。
锐评评分卡:这个基准值不值得现在跟?值得,但只值得跟第二张表。49.2% 那个数会出现在接下来两个月的每一页通稿上,配上「接近半数任务可由 AI 自主完成」之类的措辞,而它对应的是累积工作流里最轻的那一档。真要拿它衡量手上的工具,把深度 1 到 8 那条曲线存下来,等下一个模型发布时原样对照——看它是把整条线往上抬了,还是只把头抬起来了。
只抬头的那种,下个月你就会在另一个榜单上看到同一个头。
