跳到主要内容
把推测解码和 RLHF 混为一谈的人,根本就是在讨论两个不同的东西

把推测解码和 RLHF 混为一谈的人,根本就是在讨论两个不同的东西

书签客
书签客

· 阅读约 6 分钟

这条在讲 AI 写作质量为什么越来越像同一个人写的,出处是 Daniel Nwaneri 的一篇长文。他做了一个 36 种模式的个人检查清单,用来识别自己草稿里的 AI 写作痕迹,校准基准是他自己全部已发表作品。

我读到第三段才确认值得推荐——他先拎出一个最近流传的说法:推理阶段的加速手段、尤其是推测解码,在损害创意写作质量。作者直接说这个说法是错的。错在哪,他说得干净:推测解码在数学设计上是无损的,输出分布跟大模型逐词生成时完全一致。小模型快速预生成几个候选词,大模型并行验证、只接受自己认可的预测,这个过程省的是时间,不是质量。数学层面没有折损。

如果看到这里就转发,等于白读了后半段。

后半段才是他真正想说的,也才是我认为这条链接值得点的原因。他把质量下降的真凶算到 RLHF 头上,而且不是那种"RLHF 让 AI 只会说废话"的车轱辘话。他引了 Kirk 等人的研究,直接测量过 RLHF 的影响:经过 RLHF 训练后,模型输出的多样性在所有评测指标上都显著低于训练前。是显著低于,不是稍微低一点。

中间还有一处我读到了才明白为什么推荐。他给了一个数据,说创意小说的草稿接受率大概在 50% 到 65%,代码在 75% 到 85%。这个是非同行评审的基准数据,他自己也应该清楚这数字不够硬。但方向是对的,创意写作因为高温采样带来更多真正不可预测的内容,意味着小模型的预生成草稿更容易被大模型拒绝,推测解码给它带来的速度收益反而更小。所以拿推测解码给创意写作质量背锅,更是站不住脚。

这个解释本身并不新,新的是他把混淆的来源说清楚了。作者观察到人们经常把推测解码和量化这两件事搞混。量化,降低参数精度省内存,这确实可能损害输出质量。但它是跟推测解码完全不同的技术路线。一个人如果连这两件事都分不清,你没法跟他讨论 AI 写作哪里出了问题。

读到这儿我差不多要关了,觉得就是个澄清帖。然后看到他说到写作质量问题的真正瓶颈,我认为这是他整篇里最值得带走的段落。

他说写作跟代码编译不同,没有一个"编译通过"的自动可检查信号。代码训练可以靠测试用例给一个确定的反馈信号,但写作只能靠人类评分者的偏好。而 RLHF 的训练过程引导模型偏向人类评分者喜欢的内容,评分者总体上奖励流畅安全的文本,惩罚尖锐具体的内容。训练的唯一信号就是评分者对"读起来顺不顺、是不是不容易被反驳"的偏好,那训练出来的结果只能是流畅的安全平均,谁往里面训都没有第二颗钮扣。

作者把问题分成两类。非虚构写作的失败源于互相冲突的优化目标:ChatGPT 聊天的训练目标要温暖模糊,优秀技术写作需要精确直言,这俩互相打架。这在他看来是可解决的工程问题,已经不是纯理论了,OpenAI 去年 11 月的 GPT-4o 写作更新就是部分的修复方案,但他没展开讲。虚构写作的困难他一开始归因为训练数据里只有已出版小说,没有过程数据。失败草稿、多年调整、作者推翻自己的反复过程,这些都没有进入训练数据。所以模型只能模仿出版物的最终形态,学不到怎么在线编织长篇叙事和长期人物弧光。

这个论点有个漏洞。他自己在 7 月 7 日的更新里承认了。

这篇值得点开,恰恰是因为这个更新。他承认已出版小说在训练语料库中已有数百万的量级,"缺少过程数据"这个说法有漏洞。GPT-4.5 和 Llama 3.1 405B 的表现说明,仅预训练本身就能产生很强的长篇写作能力。后训练优化,尤其在 RLHF 和追求效率而缩减参数的操作之后,更有可能是主动退化了已有的能力,而不是在填补从未存在的空缺。换句话说,不是模型没学会写作,是后训练把已经会的能力磨平了。

看到这个更新的时候,我第一反应是点收藏。作者能写出这种更正,说明他前面的论点不是为了博眼球编出来的。他是在自己检查清单上发现了一个漏洞,然后补了一句话。这跟一些技术作者在文章出问题之后悄悄改原帖、不声不响的行为比起来,高下特别明显。

不点链接也能带走的一句:AI 写作的同质化不是推理加速的锅,也不是量化器干的,是 RLHF 用人类评分者的偏好当唯一的训练信号,而这个信号只奖励流畅安全、惩罚尖锐具体。没有自动检查信号,写作训练就被人类偏好卡死在这个循环里。

这条我没法顺手跑。它是观点和计量研究的综述,不是方法贴。能跑的部分可能就是他的那 36 种模式检查清单,但文章里没有公开完整的清单本身,只是举了其中几类例子,比如用逗号加 -ing 从句拖尾的句子、不点名的模糊"许多人"表述。这些例子只能靠读,没办法拿给模型复现。

再说一点不是这条链接本身的内容,是我自己读的时候被带出来的想法:我们现在有很多人对 AI 文本有一种本能的警觉。看到一段文字,觉得"这不像人写的",然后就得找一个技术原因来解释它。有时候是模型本身的问题,但更经常的是我们拿了一个听起来很技术化的说法——比如"推测解码破坏了创意"——然后当成结论传播,因为这个词听起来有解释力。但如果你去查推测解码的机制,它数学上根本不影响输出。

作者把检查清单限定在他自己已发表的作品上,不是说要搞一套通用标准。这个也很关键。说明他清楚个人写作的"平均值"和他要识别的东西不是一回事。他的清单是冲着他自己的 RLHF 修饰痕迹去的,不是给所有人做质量等级划分的标尺。

这条我推了,不是因为它解决了所有问题。它没有。RLHF 的问题在 OpenAI 和 Anthropic 都没解决,何况作者自己也不是模型厂商的人。它值得点开是因为,它把一个很多人都在复读但没人去查的解释给拆穿了。拆穿的方式不是靠嘴,是靠论文和数据。

本周 1 条。因为读到这条之后,我发现自己这周没有读到第二篇值得点开的。

书签客
书签客

只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。

查看主页 →