跳到主要内容

推理税单:算清楚账再开脑洞

毒角兽
毒角兽

· 阅读约 5 分钟

先说结论:TPCTC 那篇《The Reasoning Tax》我刷了两遍,随手拆了拆它的实验设计。值得存,但别拿它当免检通行证。

论文本身的判断倒是干脆:推理模式不值得默认开。得分任务,看努力水平,还得盯部署环境。通稿天天喊「让模型多想想」——对某些任务,这句话的另一种说法就是让 token 打水漂。

它给了个叫 Token Economy Score 的玩意儿。别被名字唬住。思路朴素得很:把准确率的涨幅,除以多烧掉的内部 thinking token,看每多付一倍代价,换回来几个点。一个边际账。专治「让 AI 多想一步」这种口号。

官方说:这玩意儿反直觉的结果不少。实测:确实。

AIME 2025 那种实打实的数学推理链,多花钱真能多办事,账算下来漂亮。结果翻到 MMLU-Pro——名义难度高、覆盖几十个学科,当年各家模型打得头破血流的地方——推理经济性低得可怜。砸进去一堆思考 token,准确率纹丝不动。

仔细一想答案明摆着:这基准强在知识调用,不在推理链。模型已经记住的东西,你让它反复琢磨半天,还是那个答案。甚至有琢磨歪的风险。论文里有句话我印象很深——知识回忆类任务,推理模式纯粹是买了个心理安慰。

但我不打算把它捧到天上去。这类论文的毛病跟模型发布会一样,看的时候得先把滤镜摘了。

那个公式的适用面窄。要到带推理开关、同家族能直接关掉推理做对照的那种模型,才能按标准姿势算。开源模型还好办。闭源前沿模型,API 一调,推理是不是真关干净了,你根本无从验证。论文给的近似方案是拿非推理开源模型做基线,再对推理模型做归一化。可这样代进去的就不只是推理的差异,模型本身能力的差距也在里面。两杯毒药选一杯。

然后是收益递减的结论。论文说推理努力水平越高,收益衰减得越狠,某些场景下额外思考反而把准确率干下去。这个我体感高度认同。上个月拿一个跨文件接口改动去试新模型,温度调低、让它多想想。结果它绕了一轮毫无必要的重构,最后我自己手动收的尾。

「部署成本乘数」那个概念倒是容易被人忽略。花在推理上的钱,大头根本不在生成给用户看的回答上。用户看到的是答案;账单上记的是模型在后台自说自话的一大段。内部思维 token 才是吞金兽。这事大家心里有数,只是很少有人摆到台面上。

本地部署是真能翻盘,还是又一种心疼?论文最后那段我很喜欢——没草草收尾,而是点出部署环境这个变量:高成本推理工作负载搬到本地,成本结构立刻变样。少了按 token 计价的 API 倍率,多了对硬件利用率的掌控。不过「可以改变经济结构」不等于「一定划算」。改完可能只是从一种心疼换成另一种心疼。

最让我在意的一句建议藏在后段:应当在模型选择时依据任务类型、努力水平和部署环境,有选择地启用推理,而不应视为普遍有益的默认模式。这话横着看竖着看,都是在怼现在评测圈默认的习惯——新模型到手,什么任务都先让推理跑满,跑出个整体分再说话。

这个评测习惯拖累谁?先污染行业榜单,再误导模型选型,最后教坏用户在真实任务里无脑开推理。回头翻各家发布文案,全在吹推理有多强。吹完代码吹数学,吹完数学吹科学推理。看着战无不胜,问一句「这些任务合不合适开推理」,没人理你。论文等于把同一个问题甩给整个行业,证据摆这,差评自己认领。

方法论部分还有值得商榷的地方:对推理链的启用只做了简单阈值,没进一步量化思考预算从 10% 提到 20% 的边际收益。不过这是后续工作,不算扣分项。

执行路径也有留白:用户层面怎么不靠翻提示词、就判断当前任务到底需要多少推理?论文没给。这题或许是留给下一代 API 设计的。

锐评评分卡:

  • 实测数据扎实 ✔
  • 分析框架基本可信 ✔
  • 「全场景默认开启推理」话术被打脸 ✔
  • 按任务结构决定推理价值,性价比和「无脑开」是两个量级

从 8 月提交到 TPCTC 接收,这个流程本身也值一句:一年收不了几篇,同行评审替你滤过一轮水分了。

这波不冤,但也别急着给所有任务安排推理。冲着「任务结构决定推理价值」去调参,和冲着「让 AI 想深一点」的口号去花钱,是两种完全不同的打开方式。被那句口号忽悠着全场景默认开启的,才是真冤大头。

论文存着。下次有人再在群里问推理模式是不是无脑开,链接甩过去。省下的口水够跑好几轮评测了。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →