先说结论:这论文是我近半年见过最敢把负结果拍上桌的。它自己发明的那个无梯度编辑器倒不算惊艳,真正狠的是它顺手拿基准照了照「反事实知识编辑」整块地基——照完发现底下是空的。
空到什么程度?一个拥有上帝视角、每条查询都能精确选中最优路由动作的 oracle 策略,跟一行什么都不想的静态策略,在所有测试组合上的差距:
+0.0000
四位小数。九个「数据集×输入条件」组合,1689 条查询,每条穷举全部候选路由动作。零。不是「差不多」那种零,是数学上严丝合缝的零。
我盯着这行数愣了几秒。知识编辑这行,SERAC 谱系那批记忆式编辑器,全指望一个「范围判断」活着——来一条查询,先判断「我存的这条编辑该不该在这里生效」。该生效改写答案,不该生效闭嘴。于是这几年堆出一堆路由模块、范围分类器、弃权策略,一个个人模狗样号称学会「什么时候不开口」。
基准一照,它们根本不需要学会。学会了也没地方用。
这论文作法干净到像故意来砸场子的:模型参数冻住,编辑内容塞外置记忆,解码时朝某个 token 的 unembedding 方向加层偏置。一开始我觉得这就是老套路换皮——偏置式编辑谁没玩过——但它赢在够简单,动作拆得开,逐一审计,没有「端到端黑盒」那种糊弄空间。
于是他们把每种候选路由行为全跑了一遍:直接答、套编辑、弃权、甚至上帝视角逐查询最优。
结果就是那行 0.0000。
问题一句话就能说透:反事实基准在评估时只会问「编辑后的答案」。你写入「爱因斯坦的出生地是日本」,基准就只问爱因斯坦出生地在哪——它不会问牛顿,不会问爱因斯坦的国籍,更不会拎个完全无关的实体出来。整张卷子只有一种题型:你刚编辑过的那道。
这种考场里「范围判断」当然是多余的。静态策略无脑套所有已存编辑,正确率天然拉满。真正会琢磨「这条查询跟我的编辑有没有关系」的模型,反而在每次犹豫里丢分。基准压根不提供「该拒绝」的负例——弃权这个动作,1689 次穷举中,一次都没当过唯一赢家。
1689 次。一次都没有。
这不是「路由没做好」,这是「路由根本没被出题」。一个拒答分类器在永远不会出现拒答场景的考场里拿满分——然后厂商出来说「看,我们的编辑精准度业界第一」。精准?精准在闭眼套模板。
论文把这归因于基准的结构性缺陷,措辞算客气了。翻译成白话:这基准能测的只有「编辑有没有被记住」,「该不该用这条」不在考纲里。
真正让我高看这论文的是后面那步。它没停在「基准有缺陷」就收工,而是亲手把缺失的负例补了出来:一半查询里,把该查询自己的编辑从索引中移除。于是突然冒出些查询——跟已存编辑相关、但又不该被它覆盖,该拒绝的时刻,终于出现了。
汇总 headroom:+0.0000 → +0.0420
弃权第一次成为唯一赢家:出现
从零到零点零四二。这个差距就是负例对路由能力的全部意义。此前那些路由模型刷出的漂亮分数,没一个是「会判断」,全是基准压根不需要它们判断。这句话值得再读一遍:范围分类器、路由选择器这些年真正的含金量,全部在此。
公道话也得说:论文没把自己包装成全能冠军。INLAY 在 Qwen2.5-7B 的 CounterFact 上输给了 WISE,并非全面领先。但「我的方法不是处处最强」和「我把你们的地基挖出来看了」是两码事。一个敢给同行照妖镜的论文,比一百个宣称 SOTA 的通稿值钱。这波不冤,照得漂亮。
