
撞死在 516:gpt-5.5 思考被砍的硬边界
· 阅读约 2 分钟
最近 GitHub 上有人扒 Codex 遥测数据,扒出一个特别邪门的细节。我一开始以为是那种"AI 变笨了"的玄学指控,看了一眼别人画出来的分布,直接坐直了。
来,把这几个数画开:
正常你想的 token 分布:
少 ────────► 多
(像一条平滑的曲线,各种长度都有)
gpt-5.5 实际跑出来的:
(516)
|||||
(1034)
||||
(1552)
||
0 ──────────┼─────┼──────┼─────► token 数量
不是平滑过渡。是在几个固定值上直接起高楼。几万条记录里,有几大千条精确地、死死地卡在 516 这个数字上。
我第一反应:这不就是截断吗?画张图,就像让模型在一个房间里思考,但房间里拉了几根隐形红线:
┌─ 思考空间 ──────────────────────┐
│ │
│ ░░░ 516 红线 ░░░ <- 撞死在这 │
│ ░░░ 1034 红线 ░░░ │
│ ░░░ 1552 红线 ░░░ │
│ │
└─────────────────────────────────┘
模型本来在转,思考到一半,吧唧,撞到 516 这根线,直接被踢出房间。管你想没想完,到数了,收工。
你以为这只是"模型推理想得多,token 自然用得多"?
等等等等,先别急。我看数据前半秒也是这么想的。但这事最反直觉的地方在这:在疯狂聚堆卡在 516 的那几个月里,整体推理 token 的消耗量是在狂跌的。月均从二百六掉到一百出头,P90 直接腰斩。
2月:随便想,均量 268,极少卡在 516
─────────────────────────────
5月:不怎么想了,均量 106,53% 卡在 516
总体预算砍了,但在 516 这个死点上扎堆的情况却越来越多。这怎么可能是模型自己"想"出来的自然分布?这就是个闸门。
作者在这个 issue 里非常克制,说这不能证明隐藏的思维链被砍了。但我看完就一个念头:这就是调度器硬塞进去的预算边界。
打个比方,这就像是超支了被财务卡报销。但这个比喻在这里漏风:现实里的"预算"通常是软性的,你超一点也能花,下不为例就行;但这个数据显示,模型是在一个非常干脆的悬崖上被切掉的。不是"劝退",是物理隔离。
懂了的那一下,真的是咔哒一下扣上了 💡
我之前一直觉得大模型推理时间变短是"变聪明了、想得快了"。可能压根不是想得快了,是桌子被锯短了。
把一个极其抽象的调度策略,变成几个肉眼可见的死数字,这玩意儿真的太酷了。
现在这个 issue 还挂在那没人接。敞着口。到底什么样复杂度的任务,是被这几根看不见的红线给活生生憋回去的?下期想不想看我接着去扒 token 计费的那些坑?
更多「Codex」的实战
评论(1)
开头说几大千条卡在516,后面又说53%都卡这,那总数到底多少?咋越看越像凑数呢