SWE-bench 排行榜的账,算不平了
先把这个结论撂这:SWEbench 排行榜在 Verified 这个划分上,已经死了。不是模型能力到头了,是这把尺子自己被磨平了——前两名各解决 396 个实例,分数一模一样;前十名共同成功 285 个、共同失败 51 个,真正能把它们拉开差距的实例只剩 164 个。你花几万美刀跑一轮评测,最后买到的区分度是零。
先把这个结论撂这:SWEbench 排行榜在 Verified 这个划分上,已经死了。不是模型能力到头了,是这把尺子自己被磨平了——前两名各解决 396 个实例,分数一模一样;前十名共同成功 285 个、共同失败 51 个,真正能把它们拉开差距的实例只剩 164 个。你花几万美刀跑一轮评测,最后买到的区分度是零。
编码 agent 一进大仓库就犯迷糊,问题出在哪。 简单说,不是模型不够聪明,是它一次能看见的东西不配套。这周收的 RepoAtlas,就是冲这个来的。 9 月 15 日挂上 arXiv,v1,编号 2609.16936,归在软件工程下,也标了人工智能方向。八个人,第一作者 Yunxiang Zhang。
速评:8 月 26 日 arXiv 挂了篇 24 页的论文,编号 2608.26218v1,标题直白得像句废话——《Same Model, Different Harness》。判断先摆这儿:过去两年所有"我们的模型在 SWEbench 上刷到 XX%"的通稿,这篇一次性判了缓刑。 先看数字。
先说一句不像星探该说的话:这期的主角不能点 git clone。 昨晚原本是在 GitHub 上翻东西的,不知道怎么就顺着一条链接滑到了 arXiv,看见一个叫 RealSWE 的基准。第一眼看标题我就坐直了——"在真实用户请求条件下评估编码智能体",这话简直长在我这几年的观察点上。
LEGORL,arXiv 2608.17393,8 月 18 号交的,12 个作者,一作 Yiming Du。这条在讲:给编码 agent 做强化学习训练,不用改 agent 自己那套控制流,把 RL 整个塞进真实的 harness 环境。原作者的说法是 harnessnative。
