先说结论:arXiv 2609.14836,本季度最该转的一篇,也是最该泼一盆冷水的一篇。该转是因为数字硬;泼冷水是因为摘要里那三个形容词,只有两个对得上账。
Green、Le Goues、Brown,三位,2026 年 9 月 13 日挂上去,主分类 cs.SE,交叉标了 cs.LO。DOI 那栏写着待定。
号都还没登记利索,就先出来讲方法论了。这很 2026。
他们抛的概念叫 hyperspecialization。人话:别指望一个系统通吃,照着单一输入类别现造一个新软件出来。
靶子是 SAT 求解,合成了几百个专供特定工作负载的求解器。平均一个 37 美元。
单个求解器平均成本: $37
对竞赛冠军通用求解器: 平均 5×,四分之一基准家族 10× 以上
拼出来的通用求解器: SAT Competition 2026 SAT 赛道冠军
这三行才是整篇论文的重量。剩下的都是包装。
摘要那句「低成本、有效且安全」,我逐字对着数字看了一遍。低成本有账,37 美元明码标价。有效有账,5 倍、10 倍摆着。
安全呢?
安全没有数字。
这就是标准的文案手法——两个能测的指标,裹着一个不能测的形容词一起发出来。你去问「安全怎么讲」,对方翻到附录告诉你「我们界定了适用范围」。可「具备可测量性能和可检查输出」这个边界本来就是你自己划的,把它写进摘要当卖点,等于什么都没说。
不过这次我得往回退半步。
我原本等着看这批专用求解器只在几个精挑过的家族上刷分,出了那几族就现原形。结果人家连通用赛道都端了。拿一百多个超专门化的原型件,拼出一个通用求解器,去 SAT Competition 2026 的 SAT 赛道拿了冠军。
预期拉满,往好的方向被打脸。这次是真的。
5 倍这个数放别处,我第一反应是查统计口径。但这里它配着一个冠军奖杯,光靠挑测试集挑不出这个结果。
好,说真正让我坐不住的那点。
那个赢了通用赛道的冠军,是一百多个只干一件事的小东西拼的。
这句话的信息量比 5 倍大十倍。它意味着「通用求解器」现在可以只是个外壳。外面挂通用的牌子,里面全是私货,谁也没规定不行。
那榜单还证明什么?
以前想刷榜,得有人力、有论文、有几年时间。现在一个 workload 三十七刀,几百个 workload 也就一辆二手车的钱。榜单第一名成了一道采购题——谁的钱包厚,谁的 agent 调度框架调得好。
这波不冤。这是 benchmark 文化早晚要来的下场。
只是「通用」这个词,从今天起得重新定义。
至于能不能搬出 SAT——这条我还没测完,先别信我这半句。
论文自己留了逃生口:可测量性能、可检查输出。SAT 恰好是地球上最干净的那类问题,喂进去,对错一跑就知道,agent 能自己当裁判,自己筛,自己迭代。
换到代码生成,换到前端,换到任何没有 oracle 的地方,超专门化立刻退化成一堆过拟合的糊裱。你连它是不是真的「更好」都判不了,因为压根没有那个一跑就出分的裁判。
所以这篇论文真正的贡献,可能不是「agent 能造软件」。是「agent 造软件这件事,严格依赖于问题里有没有一个冷酷的自动裁判」。
这个边界条件,摘要里那个「安全」一个字没提。
还有 37 这个平均数,我存疑。平均是个很脏的统计量。几百个求解器里,大概率有几个烧到三位数,有几个几乎零成本,拉出一条长尾,然后对外报 37。分布长什么样,摘要不说,我也没法替它算。
等我把 PDF 里那张成本表翻出来再说。这半句也先挂着。
锐评评分卡:论文本身不冤。数字硬,冠军硬,边界条件自己也认了,给正分。
真正冤的是明年 SAT 竞赛的评委。他们现在得坐下来讨论一个很尴尬的问题——一个用三百多美元拼出来的选手,算不算「一个」求解器。
别为了那三个形容词转这篇。为了那张 37 美元的单子转。
