这周从 arXiv 上看到一篇关于 model merging 的论文,编号 2608.28547,名字叫 DARTS,已经中了 EMNLP 2026 主会。
先说白话版它到底在干嘛。
模型合并,就是把几个在不同任务上微调过的模型,揉成一个多任务的。省显存、省推理开销,不用重训。听起来很美,但只要试过就知道,合并完每个任务都掉一点,掉的还不一样。过去几年大家处理这个问题的思路基本一致:先量出合并后 hidden state 偏离了源模型多少,再把它掰回来。
这篇论文的好看之处在于,它指出了一件事:过去所有关于“表示偏差”的研究,全是拿 encoder 视觉模型做的。
而我们现在天天在用的模型,几乎全是 decoder。自回归那种。
Decoder 的合并偏差有什么不一样?论文点了两个坑,都是 encoder 没有的。
第一个是因果关系。decoder 有因果注意力掩码,前面的 token 只影响后面的,所以某个位置上的偏差不是孤立的。它会顺着生成过程一笔一笔累积,越到后面偏得越远。这个“随位置累积”的性质,encoder 压根没有,因为 encoder 是整句一起看的,position 之间是并行的。所以拿过去那套位置无关的修正办法来硬套,等于没打中要害。
第二个观察更细。不同 token 位置的偏差,代价并不一样。生成式模型的决策点往往集中在高熵的位置——就是模型自己都不太确定下一个词该是什么的地方。这种位置一旦被偏移带偏,整个句子就拐走了。反过来,那些低熵的位置,比如一个句子里理所当然的“的”字,偏差再大也就那样,错了也无伤大雅。论文说的是“对下游损害更大”,我读下来的理解是:你需要把精力花在那些真正决定走向的位置上。
DARTS 的修法也顺着这两个坑来。第一个工具是熵加权——那些高熵位置给更大的权重去修,低熵的位置少管一点。第二个工具是逐位置加性偏置,用一组可学习的 bias 来刻画“这个位置的偏差有多少”,然后直接减掉。
思路清爽,没有花活。
值得说一句的是实验设置。论文在 Llama-2-7B 上跑了三个任务:代码生成、数学推理、指令跟随。读数比标准 surgery 方法有明显提升,而额外参数只占总量 0.1% 左右。0.1% 是什么概念?一个 7B 的模型,多出来的参数摊平了都不到一个零头,几乎不影响推理成本。
这里我插一句跑题的话。0.1% 这个数字是我看完最想记下来的。很多人一看“加参数”就皱眉,但这类 surgery 式修正,贵在动静小、切口准。它不是把模型拆了重拼,而是在原来权重旁边垫一层薄薄的修正项,不想要了随时能拿掉。这种做法的工程价值很容易被低估——模型合并本来就是为了省,如果修一次要花掉一个全量微调的算力,那不如直接训个多任务模型。
我自己不太确定的部分也标一下。论文里说 decoder 的偏差和 encoder 不同,但我感觉它说的“encoder 研究”其实更准确一点,应该限定在视觉模型那一脉。文本端的 encoder 架构不是没人做过多任务合并,比如早期的 BERT 系列就有不少类似尝试,但这几年主流注意力已经全转到 decoder 生成模型上了,所以这种对比放到今天的环境里也说得过去。这不算硬伤,只是我在读的时候觉得术语可以再收紧一点。
另外一个我没太想明白的地方是它对“位置”的处理。
论文的逐位置 bias 是把每一个 token 位置都当成独立的来建模。但 decoder 生成的时候,一个位置的偏差其实受前面所有位置影响。如果偏差能累积,那理论上一个位置上的修正,应该也要能影响后面的位置才对。DARTS 的做法是每个位置单独掰,这看起来像是把累积量直接当成了静态的位置函数来拟合,而没有显式建模传播的过程。
也许是为省参数吧。也可能是位置相关的累积在足够多的样本上平均之后,确实可以近似成逐位置函数。论文里这块没细讲,我先放在这里。如果有人读懂了,欢迎告诉我。
说到底,这篇论文更值得关注的地方可能不是方法本身,而是它把问题定义清楚了。
过去三年,model merging 的玩法基本是“直接平均”和“在权重空间里找更聪明的好位置”两条路来回走。像 surgical merging 这类只在特定层上做修正的思路,已经算是细活里的细活。但直到这篇论文出来,才有人认真去问一个问题:这些修正手段在 decoder 上,是不是根本没有做对位置?
DARTS 没有给出一个多么有想象力的解法,它做的是先把手术台照亮,告诉你刀该往哪下。
这恰恰是这类研究最容易被看懂、也最容易被低估的地方。
还有一层。普通人不一定要自己上手做模型合并,但可以留意这类研究的方向——它说明 model merging 正在从小圈子的玩具脚本走向真正考虑“我这几个模型合并起来要常用”的实用场景。等修复偏差的手法再成熟一点,也许明年年终盘点的时候,“本地跑一个合并了编程和写作能力的单模型”就会成为不值得特别说一句的常规操作。先把这条放在这里。
论文只有 7B 的实验,我心里其实还存着一个问号。模型再大一个量级,偏差累积的模式会不会变?位置相关的假设还成不成立?DARTS 标出的这几个问题,我相信未来半年会被更多论文追着跑。
本周就这些。
上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。讲错的我补,没讲清的我改。
下周见。