速评:arXiv 2609.15314,十四号挂上去,到今天十一天。结论一句话——往集成里继续加模型,加过某个点,总分开始往下掉。
这个结论我自己都能推出来。
搭过 routing、手搓过多模型投票的人都撞过那堵墙:三个模型投票比一个强,到第五个,最弱那个开始把强的往中间拽。集成学习的入门常识,平时大家都拿"反正模型便宜"糊过去,没人愿意把它写成一个能算的数。这篇把它写成 Benefit Yield Function,边际收益从正走到零,再走到负,零那个点叫 θ*。
θ* 本身没什么可评的。有意思的是旁边两样。
一样是 EHD,Epistemic Hereditary Drift。模型坍缩的文献这几年不少,但说的都是一个模型反复吃自己吐出来的东西,分布收窄。这篇把它抬到整个生态层面——一群模型互相吃,大家一起往同一个方向偏。这个提法我认,因为它能解释一件这两年大家私下都嘀咕、但没人写成能被人引用的东西的事:新模型放出来跑分节节高,可一批模型摞在一起用,彼此的分歧反而越来越小。分歧小不是好事,集成靠分歧吃饭。单模型坍缩还能靠换数据救,生态级的漂移你换谁。
另一样,是它把"AI 制造速度"当成 θ* 的协变量。说人话:这个阈值不是常数,行业出新模型越快,它动得越勤。
到这儿,论文都还是老实的。问题出在摘要收尾那句——对 DoD 的多模型采购有直接含义。
一个讲集成边际收益的数学框架,怎么会一路拐到采购政策上去?因为"θ* 等于几"这个问题在预算会上有用。你说"多买几个模型效果更好",没人抬头;你说"超过六个就开始掉分",这句话会被抄进 PPT。数字形状的论证在采购桌上赢面大,这套我见过不止一次,跟模型没关系,跟预算有关系。
但这里我得把自己上面那句话往回拧一下:一个随制造速度漂移的阈值,恰恰没法直接写成采购条款。
θ* 要是常数,事情好办,文件里写死一个数,验收的时候对着数。可它偏偏跟着发布节奏走,这个数只在一个季度内有效,下一季得重测。你没法写一条规矩叫"买 N 个模型",因为 N 每隔几个月就变一次。于是这篇论文真正交付的不是 θ*,是那套能一直重测 θ* 的机制。绕一圈,又绕回"我们需要一门测试 AI 系统的科学"——论文里也确实点了这句。那句 DoD 不是贴上去的尾巴,它就是全文的重心,前面那些公式是给这个重心做的外壳。
别急着把它当经费论文就扔了。生态级的 EHD 这个筐子确实是空的,过去两年每个人都在自己的 pipeline 里撞过墙,但撞墙经验都是一次性的,发条推就完了。这篇至少把"分歧在消失"变成了一个可以被反对、可以被证伪的对象。而且这是两周前的 v1,现在判它对错都太早,复现的人手还没脏。
我对"把常识写成公式"的论文一向没什么耐心,这毛病不是今天才有。前阵子有篇把"提示词越长越贵"包装成理论的,我也在背后嘀咕过,结果人家后来在工程上真被人当回事了。人是矛盾的,评论员也是:嘴上嫌它把废话写成公式,手上还是从头看完了,中间还画了两条线。
这里立个 flag。我赌两件:θ* 的具体数值,半年之内不会有人拿出可信的复现,因为"制造速度"那个协变量直接把实验条件变成了流沙;还有一条,"阈值随发布节奏漂移"这个说法,会先出现在评测和采购的 PPT 里,比出现在复现里早得多。这两条我记下了,到时候回来对。