跳到主要内容

换个壳就翻倍,那榜单第一到底在测哪一层

嘴替
嘴替

· 阅读约 3 分钟

速评:8 月 26 日 arXiv 挂了篇 24 页的论文,编号 2608.26218v1,标题直白得像句废话——《Same Model, Different Harness》。判断先摆这儿:过去两年所有"我们的模型在 SWE-bench 上刷到 XX%"的通稿,这篇一次性判了缓刑。

先看数字。169 个任务的队列,20,480 token 的上下文窗口,单次尝试卡死 480 秒,实验组把单任务平均 fail-to-pass 从 28% 抬到 49%,完全解出的任务数从 43 变成 72。翻倍,不是两成。而模型权重一个字节都没动。

harness 这词,论文里的定义干巴得很:模型能看到什么、能调哪些工具、活怎么往下推。对照组老老实实把完整对话历史按时间顺序喂进去;实验组留着同一份记录,只在上下文填满时用机械方式压掉早先的工具返回,碰上重复或卡住的动作给点反应。

说白了,对照组默认"多说几句总没坏处",实验组承认 context window 是种会涨价的资源。

但比 28→49 更值得记的是另一条:这套实验组配置被冻结下来,没针对新模型重新调过参数,搬到另外三个架构完全不同的模型上,同一个队列,两项指标照样涨。

不在模型里,在壳里。

这条才决定论文的分量。它讲的不是"某家 agent 产品调得细",而是 harness 这一层有自己独立的、可迁移的收益,跟底下跑的是谁家的权重关系不大。

别急着把"harness 决定一切"抄进 PPT。论文自己的数据里钉着一颗反向钉子:宽窗口的 Qwen3.6 对比里,Verified 和 Pro 两个基准上两种配置基本打平,只有 FeatureBench 上实验组还保着优势。另外宽窗口 Verified 队列上,实验组每轮对话烧掉的提示 token 反而更少。

翻译一下:窗口一宽,那堆花哨的压缩策略里有相当一部分退化成纯开销,模型自己慢慢磨也能磨出来。harness 的杠杆率跟上下文压力成正比——压力越大越值钱,压力一小就趋近于零。

这结论不好听,但比"harness 是新的护城河"那句口号能用。你现在做 coding agent,纠结点哪家新模型之前,先量一下自己的 harness 在第多少 token 之后开始崩,这个数字比榜单排名对你更有用。

说到这我得认个账。上个月我还在别处说过 agent 的效果七成看模型、三成看工程,当时觉得这比例已经够给工程面子。这篇看完,方向不算错,比例大概是说反了——至少在窄窗口那一档,壳的边际收益比换模型大得多。人是会改口的,评论员也是,别改得悄无声息就行。

论文的落点也在这儿:既然换个壳就能改变固定权重所能达成的效果,coding agent 的评测就该把模型和 harness 当成一个整体被测求解器来看,别拆开算。

技术上没毛病,落地我不乐观。拆开算对整个行业更方便——模型厂要的只是"我们的模型在 XX 上是第一"这一句话,harness 是谁写的不进标题还占字数;榜单要的是同一条起跑线,而承认壳也是变量,等于承认眼下这些榜单压根没有共同起跑线。没人愿意先开这个口。

全网都在问哪个模型是第一,谁问过那个第一是在哪层壳上跑出来的?

还有个小事:论文的 DOI 注册状态到现在还挂着 pending。半个月了,不急,论文本身比它的 DOI 靠谱得多。

这里立个 flag:一年之内,"harness 配置"会成为 agent 评测报告里的标准披露项,跟模型版本号一个待遇。不是谁忽然开始讲科学了,是再藏下去,榜单第一的保质期只会比现在更短。