先说结论:这篇机制配得上 Findings,abstract 配得上产品发布会。
前天挂上 arXiv 的,编号 2608.30922,牌子上写着 EMNLP 2026 Findings。满打满算两天,代码还没排上我手头那几个真实项目。所以这篇只拆话术层。我的规矩,48 小时内的东西叫第一印象,不叫结论。
abstract 第一句卖点就让我血压升了半格:「无需训练」。
这个组合我太熟了:免训练、即插即用、全线提升。厂商发布会这么讲,论文摘要现在也这么讲,语法是同一套。上一回我对着「即插即用」心动,代价是白搭进去一个下午——不点名了。
但这次骂不出口。因为痛点是真的。
掩码扩散这一系,长度一直是块死结:开跑之前,掩码数量先定死。答案多长,你得先猜。猜短了截断。猜长了,画布上剩一堆位置没东西可解析,算力全烧在空气上。CARVE 干的事很直接:解码到一半发现不够,往里插 [MASK],画布自己往下长。
而且它不碰权重。动的是解码过程本身,这也是「无需训练」四个字唯一的兑现方式。
不过说实话,这个思路本身不值一个 Findings。值钱的是它怎么决定「这次该不该长」。
最省事的做法是置信度:哪个位置模型没把握,就给它加空间。这条老路软得很,本质是让模型自己举手说我不行。CARVE 没走这条。
它做反事实检验。新掩码插进去之后,回头看原来画布上那些还没解析的位置——预测分布变没变?拿 Jensen-Shannon 散度,对着对齐的位置量一遍。散度低,说明新空间没有搅乱模型原有的判断,保留。散度高,说明这次变长是在硬掰模型,退回去。
一句话:长度增长不再是一个赌注,是一笔验证过的决策。
这不是调参碰出来的巧,是设计上的硬功夫。
我开头是冲着开骂去的,这半句得认账。
然后是 abstract 里我最想抄出来晒的一段:「在所有评估的模型族上都取得了平均性能提升」。代码生成加数学推理两组基准,逐个模型族过,平均下来全是正的。👏👏
「平均」这个词,和通稿里「高频用户平均省 20%」是同一门手艺。平均掩盖分布!最差那档是多少?哪个任务上退步了?退步的任务会不会恰好长成你手头那个脏项目的样子?摘要不负责回答。benchmark 的平均分和你的真实任务之间,隔着好几层滤镜,这话我写过不下一遍。
再看这句:「某些设置下推理开销仅为固定长度解码的一半 FLOPs」。
猫腻全在「某些设置」四个字!哪几个设置?为什么恰好是那几个?摘要不展开。这种量词出现在哪,哪就值得多问一句。
但这条我骂不狠,因为机制上它站得住:
固定长度: 掩码数 = 开跑前定死,猜长全浪费
CARVE: 掩码数 = 按需插入,JSD 验证通过才保留
固定长度基线等于永远按你猜的上限预付画布的钱。按需插入,只为实际长出来的部分付算力。省下的那一半 FLOPs,大概率不是魔法,是没把冗余画布的钱先付掉。注意,这半句是我的推断,没实测,先别信我。
顺带一个对「要不要跟」真正有用的信息:完整画布和分块式两种解码器它都覆盖,都不用重训。你要是手里已经在跑某个掩码扩散模型,理论上这算法可以直接叠上去试。理论上。
账还欠着一笔:FLOPs 曲线看不见墙钟时间。解码循环里插掩码、算 JSD、做位置对齐,这些额外往返在真实延迟上值几毫秒,纸面没有。这条得等代码进了项目才能补,先记着。
锐评评分卡:Findings 接收,这波不冤——反事实验证这套设计配得上。abstract 里「平均提升」和「某些设置」两处措辞,各扣一分,学术圈的发布会话术也是话术。值不值得现在跟:手头有掩码扩散模型的,今晚就把机制部分精读一遍,这个设计值得偷!纯围观等换模型的,等我拿真实任务照完这面镜子再动。照旧,先测再信,摘要留着当目录翻翻就好。