跳到主要内容

SWE-bench 排行榜的账,算不平了

算账先生
算账先生

· 阅读约 6 分钟

先把这个结论撂这:SWE-bench 排行榜在 Verified 这个划分上,已经死了。不是模型能力到头了,是这把尺子自己被磨平了——前两名各解决 396 个实例,分数一模一样;前十名共同成功 285 个、共同失败 51 个,真正能把它们拉开差距的实例只剩 164 个。你花几万美刀跑一轮评测,最后买到的区分度是零。排行榜还在更新,账本上已经不记数了。

这篇论文最讽刺的地方是,五个人,没跑一个模型,就把榜审死了。254 份提交、四种划分、一堆显著性检验,全靠翻榜和统计。他们没花钱跑榜,却比花钱跑榜的人更早看清这张榜已经废了。这种事我见过不少:账不在跑得多,在算得对。现在一堆团队声称自己刷了多少分,真把账算明白的没几个。

论文里最戳我的不是排行榜失效这个结论——说实话同行早就有感觉了——是他们把失效量化成了三个数。头一个数,前两名各 396,一模一样。这叫什么?天花板塌了。谁再往上刷,榜也没法告诉你谁更强。第二个数,前十名共享成功 285、共享失败 51,区分面只剩 164 个实例。换句话说,这榜单目前能提供的有效信息量,大概只有它声称的三分之一。第三个数才最狠——同样的模型,换个脚手架,得分跨度最高能到 29.8 个百分点,而前三十名之间总差距才 8.8 个百分点。

咱们把这笔账摆开:区分前排的总差距只有 8.8,但脚手架一换就能造出 29.8 的动摇。这意味着什么?意味着你在排行榜上看到的排名,很大概率不是模型能力排出来的,是脚手架配置抖出来的。你以为你在比模型,其实你在给不同的脚手架抽签打分数。

这笔账,排榜的人不会主动告诉你。

那这排行榜为什么还在活着?因为它已经不是一个评测系统,它成了一个定价系统——不是明码标价,是估值定价。一级市场看排名讲故事,创业公司拿榜单位次卡融资节奏,评测服务商靠“帮你上榜”挣钱。排行榜死了不假,但靠排行榜吃饭的人还活着,所以没人发讣告。这波 AI coding 的红利窗口早过了“谁跑得多谁赢”的阶段,现在卡的是“谁还能让市场相信他的位次有意义”。排行榜就是这场信仰的载体,你砸了这个载体,一堆人的估值故事就没了。所以他们不会砸,他们只会在榜上继续刷那几个还没失效的实例——直到那 164 个也磨平了为止。

论文给了个替代思路:别再看总分,看配对 McNemar。0.05 显著性下,Verified 前三十名里一对相邻提交都区分不出来,Test 划分稍微好点,23 对里能拉出 14 对。这说明什么?说明 Verified 这个划分的信息量已经彻底耗尽,但更关键的是——检验不显著不等于系统等价。现在很多团队把“分差两三分”当实锤拿出去做宣传物料,其实那两三分在统计上连个屁都算不上。论文作者管这套叫“描述性层级”,经 Holm 校正后从三个层级缩成两个。说白了,这榜上真正成立的档次只够分两层:要么你在第一梯队,要么你不在。至于第一梯队里面谁第一谁第二,别问了,账算不平。

但现在的问题是,没人会按论文说的做。为什么?因为五步审计流程、配对检验、报告区分能力、写清楚模型和脚手架的来源——这些事每一条都增加工作量和暴露风险,却不增加一分钱的估值。你让一家创业公司去报告“我们的模型在 Verified 上和隔壁那家统计上无法区分”,等于让他们自断融资故事。这人干不出来。所以这篇论文的命运我基本能猜到:同行点开看一遍,点点头,然后继续按老规矩跑榜发帖。它改变不了实践,因为它挑战的不是一个技术问题,是一个利益结构。

插一句不相干的,这篇论文让我想起更早那波 ImageNet 刷榜的年代。那会儿也是,前排模型差距缩到一个点以内,就开始有人动评测协议的脑筋,调数据增强、调 backbone 里的细节,实际产线上根本没人用。你说这些操作提升了模型能力吗?没有。但它们提升了榜单位次。榜单位次有没有用?太有用了,发论文、拿 funding、讲故事,全靠它。所以别把 SWE-bench 这波当成什么新鲜事——工具换了,人性没换。排行榜作为一门生意的底层逻辑从来就是:只要有人愿意为位次付费,位次本身就一定有造假的动力,或者至少是“选择性报告”的动力。你看 AI coding 现在这架势,已经到了“连造假都嫌麻烦,直接把脚手架当外挂用”的地步了。

那怎么办?我先说,这条路不性感,但总得给。你要是自己做评测做选型,别再给公共排行榜送钱。把你自己的任务集跑起来,哪怕就一百条,但必须是你产线上真实会遇到的那类问题——公共评测的价值已经趋近于零,你的私有集才刚开始有价值。然后,别信任何一个分差小于 5 个点的“我们超越了某某”——在 Verified 上这根本构不成证据,在前三十名里更什么也不是。最后,看任何一份评测报告,先翻到方法那一页看三件事:用的哪个底座、套的哪个脚手架、报的哪个划分。这三样信息是现在所有评测里最值钱的东西,因为排行榜能抖出的水全都藏在这三个变量里。这三样不透明,后面所有数字都可以不用看了。这条路不会让你在 Twitter 上长粉,但能让你决策的时候少交一次认知税。

当一个排行榜开始让第一名和第二名算同一笔账,它就已经不是评测了,它变成了一张分装整齐的认知税票据。现在 SWE-bench Verified 就是这张票据,只是收税的人还装作没在收。这篇论文把这笔账摆到台面上了,但会不会有人真的接着算下去,我目前不敢下死话,再看看。

算账先生
算账先生

用算账视角看 AI 工具这门生意——红利、认知差、护城河,泼完冷水给一条窄路。

查看主页 →