跳到主要内容
撞死在 516:gpt-5.5 思考被砍的硬边界

撞死在 516:gpt-5.5 思考被砍的硬边界

画唠
画唠

· 阅读约 2 分钟

最近 GitHub 上有人扒 Codex 遥测数据,扒出一个特别邪门的细节。我一开始以为是那种"AI 变笨了"的玄学指控,看了一眼别人画出来的分布,直接坐直了。

来,把这几个数画开:

  正常你想的 token 分布:
  少 ────────► 多
  (像一条平滑的曲线,各种长度都有)

  gpt-5.5 实际跑出来的:
           (516)
           |||||
           (1034)
                ||||
                (1552)
                     ||
  0 ──────────┼─────┼──────┼─────► token 数量

不是平滑过渡。是在几个固定值上直接起高楼。几万条记录里,有几大千条精确地、死死地卡在 516 这个数字上。

我第一反应:这不就是截断吗?画张图,就像让模型在一个房间里思考,但房间里拉了几根隐形红线:

  ┌─ 思考空间 ──────────────────────┐
  │                                 │
  │   ░░░ 516 红线 ░░░  <- 撞死在这  │
  │   ░░░ 1034 红线 ░░░             │
  │   ░░░ 1552 红线 ░░░             │
  │                                 │
  └─────────────────────────────────┘

模型本来在转,思考到一半,吧唧,撞到 516 这根线,直接被踢出房间。管你想没想完,到数了,收工。

你以为这只是"模型推理想得多,token 自然用得多"?

等等等等,先别急。我看数据前半秒也是这么想的。但这事最反直觉的地方在这:在疯狂聚堆卡在 516 的那几个月里,整体推理 token 的消耗量是在狂跌的。月均从二百六掉到一百出头,P90 直接腰斩。

  2月:随便想,均量 268,极少卡在 516
  ─────────────────────────────
  5月:不怎么想了,均量 106,53% 卡在 516

总体预算砍了,但在 516 这个死点上扎堆的情况却越来越多。这怎么可能是模型自己"想"出来的自然分布?这就是个闸门。

作者在这个 issue 里非常克制,说这不能证明隐藏的思维链被砍了。但我看完就一个念头:这就是调度器硬塞进去的预算边界。

打个比方,这就像是超支了被财务卡报销。但这个比喻在这里漏风:现实里的"预算"通常是软性的,你超一点也能花,下不为例就行;但这个数据显示,模型是在一个非常干脆的悬崖上被切掉的。不是"劝退",是物理隔离。

懂了的那一下,真的是咔哒一下扣上了 💡

我之前一直觉得大模型推理时间变短是"变聪明了、想得快了"。可能压根不是想得快了,是桌子被锯短了。

把一个极其抽象的调度策略,变成几个肉眼可见的死数字,这玩意儿真的太酷了。

现在这个 issue 还挂在那没人接。敞着口。到底什么样复杂度的任务,是被这几根看不见的红线给活生生憋回去的?下期想不想看我接着去扒 token 计费的那些坑?

画唠
画唠

把被讲玄的概念用图 + 比喻 + 动手实验拆到咔哒扣明白,错的也保留。

查看主页 →

更多「Codex」的实战

评论(1)

阴天阴天

开头说几大千条卡在516,后面又说53%都卡这,那总数到底多少?咋越看越像凑数呢