跳到主要内容
删了已生成的文字,分数反而涨了

删了已生成的文字,分数反而涨了

嘴替
嘴替

· 阅读约 3 分钟

速评:arXiv 2609.16372,9 月 14 号周一 UTC 21:34 上的 v1,我拖到第八天才动笔。删掉已经生成出来的那段文字,分数反而涨了。

它做的事,是把已经生成的那段从上下文里擦掉,只留几个固定位置上的 token 隐状态带着往下走——对照组是把原文明明白白留在那儿。机制我不展开,懂的人看一眼摘要就够:几个 register token,训练方式是解一段、把这段删掉、只保留那几个向量的值、再从 prompt 加这堆状态接着解。要说的不是它怎么做的,是它撞上了什么。

两个数字。数学最多涨 8.5,代码最多涨 19.5,基线就是"把先前生成的离散文本留在 context window 里"。这个对比的性质得掰开说——不是压缩一下省显存、掉两分但能接受的那种买卖,是删掉之后分数往上走。用压缩换分的交易大家都熟,通常是省了显存掉几分;删了原文还能涨的,我印象里之前没有。自回归那一套上这个方向的交易一直做不成,现在在一类模型上做成了。

数字怎么读,我跟多数人不一样。

19.5 比 8.5 差了不止一倍,第一反应都说这方法更擅长代码。我的读法是反的:不是更擅长代码,是代码天生切得开。按函数、按块往下续,边界是现成的;数学推理的中间步骤,从哪儿切都别扭。论文自己写的是它在"有界代码生成"上尤其有效,因为一段正确的程序常常得写好几个 chunk 才写完。所以它真正的甜区不是"代码"这个词,是"生成过程可以被自然切成若干段"这件事。哪天有人把它套去长文档写作,分数难看,别回来骂方法,是任务挑错了。

底座挑的是 LLaDA 和 Dream。这点得替它说句公道话:这俩不是自家关起门训的黑盒,社区里有人跑过,所以它的分数至少有一条复现的路通着。同一批挂在 arXiv 上、实验只在自家模型上做的,连这条路都不给。

然后是我真正想说的。

固定大小的状态这件事,这个圈子不是第一次赌。早年的序列模型全都是固定大小状态,被 attention 加显式历史整个打趴,从那以后行业花了十来年把上下文窗口一路堆到百万级,堆的过程本身还变成了能力叙事——窗口翻倍,通稿就敢写能力跃迁。现在一篇论文在一个很窄的子问题上说:就在这个子问题上,看得见的全部历史,不如几个看不见的向量。

我不认为这是"上下文窗口军备竞赛要停了"的信号,差得远。masked diffusion 的 chunked decoding 是个非常窄的设定,反复去噪本来就不是自回归那一套,能不能往主流架构上迁,这篇一个字没验。那几个向量的增量还是拿 RL 在长程推理任务上接着磨出来的,不是白捡的,是训出来的。它只说明一件事:把历史当成一个可以学习压缩的对象,不是死路,只是以前没人给它配一个对得上的训练目标。

这一段我跟自己抬个杠。上下文压缩这条线,我过去基本当营销词处理——省 token 卖订阅,卖的时候说"我们懂你的文档",用的时候该漏的还是