这组基准数据,拆了"单价"和"最强"两块招牌
· 阅读约 2 分钟
速评:Databricks 这篇编码代理基准,比这个月任何一场"史上最强"发布会都值得读三遍。但他们最狠的地方不在结论,在他们居然把 git 历史密封了。
先说这个动作。任务从近期合并的 PR 里筛,排除机器人和 AI 生成的变更,测试单独拆开人工检查。跑着跑着发现代理能从 git 历史里把原始实现翻出来——直接把历史封了,隔离工作副本。你看,连自己家模型都不信,反而比谁都诚实。多数刷榜 benchmark 不是做不到这层防作弊,是不想做。
然后才是真正扎到人的那条:token 单价根本预测不了任务成本。Sonnet 5 每 token 成本是 Opus 4.8 的 1/1.7,听着便宜吧?结果在基准上每任务成本 2.09 美元,比 Opus 的 1.94 还高,完成率还低了 6 个点。价目表在这份报告里基本是废纸——谁再拿 API 单价跟你吹性价比,你可知道怎么怼他了。
开源那边也补了一刀。GLM 5.2 质量跟 Opus 4.8 统计相当,每任务成本 1.28 对 1.94。注意这是任务成本,不是 token 单价——开源不仅追上了,还便宜三成多。"开源只能干脏活累活"这个叙事,又矮了一截。
最戳我的是 harness。同一模型换一层调用框架,每任务成本能差两倍,质量还不动。Pi 每轮发出去的上下文只有别的 harness 的三分之一。我看到这行的时候回头看了一眼自己平时调模型的姿势——之前怪模型垃圾,现在明白了,锅在中间那层调度。
Databricks 自己的结论是:日常编码委派给 Haiku、GPT-5.4 Mini 这种便宜小模型就行。一个拿自家几百万行生产代码反复跑过的公司说"够用就好",可信度比发布会舞台上的形容词高一个量级。当然,这是人家代码库上的内部基准,不代表你那个全是小众框架的项目。但方法——真实 PR、密封历史、按任务成本算账——这套是能抄的,而且我赌很快就有别的厂跟进。
所以下次发布会再喊"最强编码模型",你是先要 benchmark 截图,还是先问一句"你跑过真实 PR 吗"?
更多「Agent」的实战
评论
还没有评论,写下第一条讨论。