Sakana AI 那篇 PC-ALM 出来,我盯着看了一下午的不是 1000 层残差 MLP 能训这件事,也不是它在 Fashion-MNIST 和 CIFAR-10 上追到反传两个百分点以内——是作者把增广拉格朗日接进预测编码的推理更新时,每层引入的对偶变量 λ_i,在平衡点上编码的恰好就是反传的信用信号。
这个对应关系,LeCun 在 1988 年就写过了。不是提了一嘴,是正儿八经把拉格朗日乘子和反传信用信号之间的桥搭好了。1988 年。
我把它叫做:翻旧账。
讲这个词之前,先说我为什么烦现在这个社区的一个习惯。太把“新”当回事了。一篇新论文贴出来,抢的是命名权、赛道定义、谁先把那个词占住。但没几个人回去翻旧纸堆。PC 这套思想从上个世纪的 Helmholtz 一路传到 Rao 和 Ballard 1999,中间断过几十年,直到预测编码被重新捡起来当反传的替代品。这中间哪一步靠的不是翻?这回 PC-ALM 也一样。标准 PC 在窄而深的网络上信号衰减——层数一上去,逐层预测误差的范数往下掉,信用传不远。这个坑大家看得见,PC-ALM 的解法是把标准 PC 的自由能换了,换成增广拉格朗日。而增广拉格朗日在分布式优化里被人踩了多少年?LeCun 更是三十多年前就把那座桥搭好了。没人想起来去翻。等 Sakana 的人把它和 PC 的能量项摆到一起,你才看见这两块拼图本来就该拼上。这不是什么横空出世的新发明,是把旧账翻出来、擦掉灰、发现它正好卡在今天这个没解的死角上。
所以这个名字不是贬义。我是说,这行该给自己立条规矩:死胡同卡得所有人绕道走的时候,先别急着造新轮子,回去翻那些被引用两次就再没人读的旧论文。LeCun 1988 就躺在那儿三十多年,像块早刻好答案的石碑,但没人低头看,因为大家默认老方法等于过时方法。
有人会争:PC-ALM 的核心贡献不是翻旧账,是把增广拉格朗日接到 PC 的推理动力学里去。原文那个对偶变量上升的步子,每层像 PI 反馈控制器一样跑局部递归,比例项和积分项一块儿把信用波前从输出层往回推。没错。可这套 PI 控制器的骨架,正是 LeCun 那笔旧账上的东西。换个说法:要是这个社区翻旧文献的习惯再差一点,这篇论文根本不会出现。因为写它的人得先信“1988 年那个结果今天还有用”,信这一条,才会往那个方向去找。
你大概也撞见过类似的事。有人在推上说 2026 年的某个新技巧“终于解决了”什么问题,底下有人翻出一条 2015 年的论文,说这不就是那谁谁提过的;组里技术分享,有人兴冲冲讲个新框架,角落里老工程师一句“这不就是当年的 xx”给掐了。这些事散在各处,单看都像个人习惯,摆到一起就显出来了:这社区没有“翻旧账”这个动作的公共名字。大家各翻各的,翻到了也不在 related work 里认真交代,最多致谢里轻飘飘提一嘴。
这块空地,得有个名字。承认“翻旧账”是从业者的正经动作,不是考古爱好,不是显摆文献量——把它摆上台面,卡住的人才想得起来多问一句:这个死角,旧纸堆里有人踩过没有?
你应该把这个词认领走。下次开组会、写 related work、被某个反传替代方案卡住的时候,先别急着搜 2026 年的 arXiv,去翻三十年前那批你以为早过时的老论文。翻到了,就在笔记里单开一栏“旧账”,把老结果的名字和年份记下来,再拿它和今天的问题对。翻不到也不亏——至少你知道这个死角的旧账从哪一年开始断的。
还有个观察我单独拎出来说。PC-ALM 把信用传播从标准 PC 那种扩散式、热流式的慢传导,改成了弹道式的波前推进。标准 PC 在推理初期只有最后几层在动,信用信号像堵墙一样从输出端往回推。PC-ALM 的原始对偶动力学推得明显更快——这个“快”不是白来的,是那套拉格朗日乘子在当推土机,正好把深窄网络里的衰减坑给填了。旧账翻出来,不止理论上闭环,工程上能救命。
当然,PC-ALM 自己也没把旧账翻到底。作者明说了:收敛时放弃了标准 PC 的“前瞻配置”。稳定激活和普通前向传播不一样的那个特性,能提样本效率,但改善信用传播的代价是把它丢了。中间设置 T、α 和对偶泄漏能不能两边兼顾——旧账还没翻干净,新账已经欠上了。
行,这周的号吹到这儿。这个词请你认领走。下次卡在信用传播、卡在深层窄网络、卡在某个你没听过但三十年前就有人解了一半的问题上,先问一句:这个旧账,翻过了吗?
作废条件放这儿:三个月内如果没人真去翻文献、没人真的在卡住的时候多查一篇老论文,只是嘴上挂着“翻旧账”三个字当装饰,那我就回炉,不占这块空地。翻旧账不是徽章,是动作。没动作,名字就是空号。
