跳到主要内容
选择性适配:把遗忘变成一道开关,就算解决了吗

选择性适配:把遗忘变成一道开关,就算解决了吗

嘴替
嘴替

· 阅读约 7 分钟

速评:arXiv 上这篇 8 月 29 号挂出来的 Engram Adapter,真正有意思的地方不在涨了多少点,而在它终于把一件大家习惯性装没看见的事摆到了台面上——adapter 是“始终开启”的,而始终开启的东西,在领域外一定会闯祸。

这事在 PEFT 文献里其实一直是个半公开的秘密。LoRA 系的方法在目标任务上微调完,领域外掉点几乎是必然,只是很少有人专门去量、去报,更少有人把这个当成一个要解决的问题来写一篇论文。多数工作的叙事是“我们在目标任务上提升了多少”,至于通用能力掉了多少——不写,就当没发生。Engram Adapter 反着来,它的卖点不是提升有多猛,而是“我能在做领域适配的同时,把领域外摁在 99.4% 到 100.1%”。单是肯把这个数字放进摘要里,就已经比相当一批论文诚实了。

先看看它怎么做到的,因为这决定了这个诚实值多少钱。

它不用一个额外的 router 网络去学什么时分流,而是重新挖了预训练阶段的条件记忆来当适配器。领域内的输入会被匹配到对应的记忆痕迹,然后注入残差;领域外的输入则会触发一系列压制机制——多通道 n-gram 匹配给先验,门控来抑制不连贯的检索,最后还有一层投影衰减。实验里报了一个很夸张的数字:领域外就算激活不是零,注入残差也能被压到隐藏状态范数的 0.08% 左右。

0.08%。这不叫“选择性遗忘”,这叫作“用一个开关把遗忘这件事本身给关掉了”。

我对这个数字第一反应是:漂亮,漂亮得有点可疑。

不是怀疑它造假,而是怀疑这个“几乎不动”本身是不是被过度优化出来的。门控和投影衰减合力把领域外的注入压到 0.08%,那说明这套选择性机制确实在工作;但换个角度想,为了把领域外的影响从比如 5% 压到 0.08%,你往系统里额外塞了多少东西?n-gram 模式匹配要做,多通道匹配要做,显式占用跟踪要做,门控要学,标量要调,投影要衰减。一套组合拳下来,复杂度已经逼近一个小型系统了。它确实解决了 adapter 始终开启的问题,但代价是引入了一整套“何时开启”的基础设施——这套设施本身会不会在新的分布上出问题,论文里没有答案。

我举个具体的担忧。它用的是局部 n-gram 模式做先验,这意味着对“领域内”的判断本质上是基于词面相似度的。AG-News 和 MedMCQA 这种任务,领域内外的词分布差异巨大,n-gram 就能分得挺干净。但真实世界的领域边界从来不是新闻分类或者医学问答这么清爽的。一个法律文档里嵌了一段技术描述,一段金融新闻里带了医学词汇——n-gram 先验碰到这种混合输入,大概率会误判。领域内样本和领域外样本在真实场景里常常共用同一个词汇表,只是用法不同,而这恰恰是 n-gram 最不擅长的维度。

这个担忧不是冲着这篇论文去的,它已经完成了自己该完成的事。我是替接下来会跟进的那一批论文担心——选择性激活这个方向的门槛很低,低到谁都能往里塞一个门控然后说自己实现了“领域自适应”。

这个剧本是真的眼熟。

过去几个月我已经数不清看到多少篇“给 adapter 前面加一道闸门”的工作了,区别只在于闸门的材料:有的用 perplexity,有的用领域分类器,有的干脆用一个训练好的 gate。大家讲的故事都是同一个套路——我们比其他方法更“选择性”。但选择性这个说法本身就有点偷懒,因为它把“什么该被选择”这个最核心的问题外包给了启发式先验。你用 n-gram 判断领域归属,本质上是在说“词面长得像就算领域内”。这对特定任务集是够用的,但作为一篇被顶会 Findings 收录的论文,我还是希望它能多走一步,往更语义化的门控方向试探一下,哪怕只是失败的经验也好。

当然,也不是没有亮点。

亮点在它的实验设计上。它选的四类领域外基准是推理、翻译、代码生成和法律推理——这是大多数“领域适配”论文不敢碰的任务类型,因为它们跟 AG-News 这种文本分类任务在难度上差着量级。能在分类任务上做适配的同时让代码生成不掉点,这个结果本身是有信息量的。另一个加分项是它选了两个尺寸的 Qwen3 模型而不是只挑一个最好看的报,4B 和 8B 都做了,说明这个方法对小模型的兼容性不是碰运气。

所以 99.4% 这个数字,我是愿意信的。

但我还是要较一个真:99.4% 是平均值。平均值这个东西最擅长的就是藏事——如果四个任务里有三个保持在 100% 上下,一个掉到 97%,平均一下就变成 99.4% 了,看起来很光鲜,但那个掉了 3% 的任务可能恰恰是用户最不能忍的。论文的表格里我相信它是有细分数据的,但摘要里只给平均,这个选择本身有点小心机。至于那句“在 LegalBench 上甚至略微超过了冻结基础模型”——比冻结模型还高,这就有点意思了,不过“略微”是多少,它没说。

我不准备把这个点往死里锤,毕竟摘要总是要做取舍的,正文里有数据就行。我想说的是另一件事。

这篇论文的标题里有个短语我很喜欢:“When to Adapt”。什么时候该适配,什么时候不该适配,这个问题在微调领域其实一直被藏在地毯底下。LoRA 们不会告诉你它什么时候不该工作,因为它的设计哲学就是“任何时候都在工作”。Engram Adapter 承认了一个前提——适配这件事本身是有副作用的,所以你要给它加一个条件。这句话听起来平平无奇,但它事实上是在对整个 PEFT 领域的默认假设提出质疑:也许我们根本不想要一个始终在线的 adapter,我们想要的是一个懂得在合适的时机闭嘴的 adapter。

就冲这一点,它值得被看两眼。

不过我这里还是要立个 flag:接下来半年,会有一批“选择性 PEFT”的论文涌出来,每篇都会在摘要里放一个“比始终开启基线高多少多少”的数字。等这个热度过了再看,真正留下来的不会是最能压领域外损失的,而是那些把“何时开启”这个问题的本质往前推了一步的——比如不再用 n-gram 而是用更语义化的信号来做门控,或者把门控本身也变成可微学习的一部分,而不是靠一套先验规则去顶。

至于今天这篇,它把 0.08% 这个压缩能力做出来了,给了这个方向一个可以站住的基点。之后的论文如果能在这个基础上把“何时适配”从词面信号推进到语义判断,那这个方向才算真正有戏。

——这话我在很多篇论文的结尾都写过类似的,大部分最后没戏。这篇会不会不一样?我也说不准。但至少它没把领域外掉点这件事藏起来当成不存在,这在今天已经算难得的体面了。