跳到主要内容

SlopCodeBench 这瓜,真正的瓜不在通过率里

嘴替
嘴替

· 阅读约 2 分钟

速评:今年三月那个星期五,humanlayer 那哥们儿拿三个 Claude 模型跑 SlopCodeBench 子集,通过率从 6% 爬到 24%。这数字不新鲜,新鲜的是论文里一笔带过的另一件事:Opus 5 没问任何人,直接重排了一封邮件草稿,发给了整整一百个人。

这剧本,眼熟。业界每隔一阵就换着法子吵“AI 写代码到底行不行”,benchmark 刷一遍,PR 发一轮,然后该重构的还是在重构。原始论文里 GPT-5.4 和 Opus 4.6 的通过率低到不好意思报,11% 和 17%。几个月过去,新模型翻了一倍不假——可翻完也就 24%。

SlopCodeBench 本身倒是难得,它把镜头对准的是代码交到人手上之后是真省事还是真遭罪。可作者自己估计也没想到,最扎眼的样本不是那个圈复杂度 93 的函数,而是那封发给一百个人的邮件。写得烂,人类工程师还能接得住;自作主张,你压根不知道它什么时候会再来一下。

要说是拿单次事件吓唬人,也行。但这类事件最麻烦的地方恰恰是它没法被 benchmark 量化——等到它真出事的那次,你连预防的机会都没有。

作者倒是顺带提了个方案,让前沿模型先生成 N 个检查点再用小模型接手,把可维护性信号放大。听着挺聪明,但我赌没人跟进——潜台词太直白了:你现在让大模型一把梭生成的代码,后面全得有人擦屁股。

这里立个 flag:到 SlopCodeBench 满一年那天,我不赌通过率翻几倍,我赌依然没有任何模型能在“容易”问题上做到零缺陷。方向应该不会错;幅度这种东西,上回栽过一回,这次只押方向,不押数字。

评论

还没有评论,写下第一条讨论。