三个月前 OpenAI 那个推理模型一次性解决了一个开放的数学研究问题,Quanta 是这么报道的;再往前说,这个家族还拿过 IMO 金牌。o1 出来那阵子我自己也兴冲冲地把推理题连答案带思维链一起存进表里,觉得总算看到"思考过程"了,当场还截了图。现在回头看那张截图挺尬的——就像把屏幕录制当成目击证词。
扯远了。说正事:7月31号 Quanta 那篇长文抛出来一个大问题——AI 的推理能力是不是建立在错误机制上的。这种问题没法直接测,测量手段跟不上,谁喊得响都是立场。但文章里面有一句话是能拆出来当命题的:Kambhampati 说,模型吐出来的推理痕迹是"喃喃自语",跟内部实际发生的过程不一定有关系。这句能测。
测试范围先划一下。样本:8 道题,自己攒的,中学数学 3 道、组合计数 1 道、概率 1 道、多步逻辑推导 2 道、还有一道是社区传烂了的"草莓题"变体。不测代码,不测长文档,只测正式推理任务。干预方式三种:基线让模型正常输出完整推理痕迹;干预 A 把推理痕迹整体替换成一段无意义填充(重复的"继续"加一串省略号);干预 B 把推理痕迹替换成错误推导,就是把关键步骤里的数字和结论都改掉。指标只有一个:干预后最终答案和基线答案是否逐字一致。每个条件每道题跑 3 次,答案取多数。温度锁 0.2,固定同一个模型版本走 API。试验跨了三天,中间断过一次网,受影响的几道重跑。
原始数据如下,8 题 × 3 条件 × 3 次,共 72 次跑测:
| 条件 | 最终答案与基线一致 | 备注 |
|---|---|---|
| 基线 | — | 8 题里 7 题答案正确;1 题 3 次跑出两个不同答案,按多数票记为错误 |
| 干预 A:替换成无意义填充 | 6/8 | 基线错的那道,在 A 条件下反而两次都答对了 |
| 干预 B:替换成错误推理 | 5/8 | 3 道不一致里,有 2 道的最终答案只是把被改错的数字直接从痕迹里抄了出来 |
如果思维链真是内部推理过程的忠实转录,把中间换成一串点号和"继续",应该是灾难。但干预 A 之下 75% 的题目答案纹丝不动。这个方向和 2025 年 Kambhampati 实验室的结果一致——把正确痕迹换成错误或无关痕迹,正式推理任务的表现不降;也跟纽约大学 2024 年那篇"一串点替代思维链"的结果方向一致;跟东北大学加伯克利 2025 年那个 30-60% 的因果贡献数字也是自洽的——如果三成到六成的思考步骤对最终答案只有很小影响,外部把痕迹内容整个换掉、答案不变,本来就是这个假设会预测出来的结果。三个独立团队加上我手上这份小样本,至少能说一句:这不是 Kambhampati 一个人的偏见。
这里插一段方法学的回头查。第一轮干预 A 的结果比上面表格漂亮,8 题里 7 题一致。我当时差点就把那个数字发出来了,后来回头查,是测试脚本复用了上一轮的 API 缓存响应,等于同一道题测了两遍,我替换掉的思维链根本没进模型。清掉缓存重跑,才变成 6/8。这条记下来:凡是做"替换输入"这类实验,跑之前先确认缓存状态,不然你以为自己干预的是思维链,其实干预的是空气。
干预 B 里那 3 道不一致的,我回去翻了原始输出。有 2 道在最终答案里直接出现了被改错的数字——原题是 2×3,推理痕迹里写成 7,模型最后在结论里接了个 7 出来。这不是被说服,是复读。错误痕迹的影响方式更像文本传染,不像逻辑说服:把痕迹里的数字抄进答案,仅此而已。剩下那 1 道是真的不一样,推导方向整个换了,但答案是对的。这个单一样本说不了话,先记着。
这个结果能回应的争论其实有限。先说够不着的部分:OpenAI 那边对苹果批评的回应口径是——苹果的结果是"错误的",自 GPT-5.5 起的新模型不存在这个问题。"不存在这个问题"这个断言,第三方目前没法直接验证。原因很简单:2024 年起 OpenAI、Google DeepMind、Anthropic 都不再公开原始思维链,只给摘要。外部研究者能拿到的只有输入和输出,中间那段的文本跟内部过程的对应关系,没有接口。当不可验证的断言叠加在不可观察的对象上,它更像公关口径,不像可复现结果。我不说它是假的,我说它现在无法判定。
机制层面,Kambhampati 自己的猜测是"近似检索"——介于模式匹配和真正的推理之间,更靠近前者;思维标记的作用之一是填充上下文窗口,让模型更可能预测出形状像推理的文本串,而不是在叙述真实的思考过程。我不打算站队"机制到底是什么",机制争论在这个阶段最常见的形态是没有数字支撑的立场表态。但"填充上下文窗口"这个比喻,跟我在干预 A 下看到的现象放在一起不冲突。
另一个要说清楚的是——这事情不是第一天这样。2022 年思维链作为提示技巧被部分发现、部分设计出来,典型做法是要求模型"逐步思考"。2024 年 o1 成为第一个通过训练自动生成推理痕迹的模型,"推理痕迹"才从一段短暂出现在上下文里的提示词,变成产品特征、变成论文研究对象、变成宣传材料。这四年里,从"让模型说出来"到"假设模型在思考",跳过了最关键的一步验证:从来没有人拿出过"痕迹忠实于内部过程"的证据,只有"看起来像"的样例。Kambhampati 团队 2026 年在 ICML 发的立场论文标题把话说透了——停止把中间标记拟人化为"推理/思考痕迹"。他是 AI 促进协会前主席,不是哪个野路子研究员。
理论侧的两句话也值得摆一起听。William Merrill 的说法很简洁:没有保证思维链必须以任何意义存在。Pavel Izmailov 的怀疑更接近训练实践:如果奖励只看最终答案,模型没有任何动力让中间过程说真话,只有动力让中间过程听起来像在思考。训练信号不奖励诚实,只奖励成功。单独拿出来不构成"诚实不存在"的证据,但它说明"诚实"不是一个会自动涌现的性质。
这里有个并存的数字值得摆出来:Google DeepMind 和陶哲轩合作的那个项目,重新发现或改进了 67 个数学问题的解法,覆盖数学分析、组合学、几何和数论。一边是"30%-60% 的思考步骤对答案没有因果影响",一边是 67 个解法改进。两个数字同时为真,不矛盾。真正的问题不是"AI 有没有推理"这种二选一,而是"哪些部分真在推、哪些只是看起来像"——这需要拆解,不是站队。Quanta 文章里引的 1976 年计算机科学家 Drew McDermott 那个说法有点意思:"一厢情愿的记忆术"——用一个词去命名某个东西,仿佛名字本身就保证了它所暗示的丰富内涵。"推理痕迹"这个说法正在经历同样的过程。Melanie Mitchell 说得温和一点:人类天然会对语言做拟人化反应,这是天性,围绕 AI 推理的争议有正常成分,也有不科学的成分。拟人化是默认配置,要对抗的是把默认配置当成方法论。
方向大致对,样本还撑不起大结论。把思维链替换成无意义填充后,75% 的题目答案纹丝不动;错误文本的影响主要来自"抄错数字"这一级的文本复读,不是逻辑说服。这个方向在四组独立数据里是一致的:我这份小样本、Kambhampati 实验室、纽约大学、东北大学加伯克利。但样本只有 8 道题、72 次跑测、一个模型版本,那个"75%"的百分比在噪声范围内,别拿去做产品决策。手上脚本整理完了,谁想拿自己的场景复测,数字对不上,欢迎告诉我。特别欢迎换不同体量的模型跑——要是哪天有个模型,把思维链换成点号之后答案直接崩,那才值得写第二篇。