697 tokens/秒。同类第 3。
智能指数 12 分,176 个模型里排第 91。
这两个数字摆在一起,多数人第一反应是:一个快但不太行的模型。
未必。
我不同意的不是数字,是数字背后的排序默认——聪明是主菜,快是配菜。主菜不行,配菜再香也没用。
这个默认在评测场景里成立得毫无争议。评测是一问一答,一个问题进去,一个答案出来,判分只看对不对。没人掐表,也没人关心模型想了多久。这套框架下速度当然靠边站,甚至不进评估项。
问题在于,模型被真正用起来的地方,越来越多不是一问一答。
agent 循环是最明显的例子。你让它做一件事,它拆成十几步,每一步的输出变成下一步的输入,来回十几二十轮。这种任务里总时间不是单步时间,是单步时间乘步数。速度快 6 倍,总时间就快 6 倍,这里基本是纯乘——只有首 token 延迟那一项不跟着缩。
同价位推理模型的输出速度中位数是 111.7 tokens/秒。Mercury 2.5 是 697。6 倍的差距,在二十步的循环里还是 6 倍的差距。这不是"体验更顺滑"能概括的。
再走一步。
如果时间预算是固定的——我今晚就一小时,让 agent 把这件事做完——那快模型能试的次数就不一样。慢的跑一遍,快的能跑六遍。六遍里挑一遍,或者让它们互相校验,这个动作本身就是一种便宜版的聪明。
我们习惯把"聪明"理解成一次做对的概率。但真实使用里,决定结果的还有"你有多少次机会做对"。这两件事的乘积才是你拿到的完成度。排行榜只量了前一项。
写到这里我得改一下前面的说法。快不是"另一种聪明",这话说满了。快是让你能用另一种方式换到结果的资源。用资源换结果和用能力换结果,是两条路,不该拿同一把尺子量。
你可能会反对:跑得快有什么用,方向要是错了,跑得越快离得越远。
这话对。但得看它错到什么程度。12 分对 13 分的中位数,这不是"跑错方向",是中游偏下一点点。在一个 176 个模型里排 91 的智能水平上,速度排第 3。这个不对称太极端了——一边略低于平均,一边挤进前排。压扁成一句"快但不太聪明",就把这个不对称抹掉了。
还有个数字值得停下来看:智能指数评测里,它一共输出 3500 万 token。同类中位数是 1 亿。冗长度排名第 14。
多数人读这个数字,读出来的是省钱。确实省,混合价格每百万 token 0.14 美元,缓存命中打一折。但省钱是最没意思的那一层。
有意思的是,在 agent 循环里,输出不会消失。这一轮说的话会成为下一轮的输入。输出少三分之二,意味着上下文增长慢三分之二。十几轮下来,一个模型还在轻松呼吸,另一个已经在拼命压缩历史、开始遗忘开头交代过的东西。这不是价格问题,是能不能把活干完的问题。
简洁还有一层更隐蔽的影响,我不确定它成不成立。
我怀疑推理模型的分数,有一部分是靠"想更多"换来的。扩展思考在数字上的表现就是更多 token。一个天生话少的模型,在同一套规则下是吃亏的。
¹ 这个怀疑很容易被证伪。如果评测对思考长度做了归一化,或者这些评测项的答案本来就不受输出长度影响,那我这段就不成立。我没核对过每一项的实现方式,这里只是提一个方向。
² 得说清楚,这些数字来自第三方评测的汇总,我没有实际跑过这个模型。它是闭源的,权重没公开,参数量也没披露。我讨论的是"评测画像呈现出来的样子",不是"这个模型真实是什么样"。
那它有什么问题。
首 token 延迟 3.59 秒,中位数 2.18 秒。它是先想很久,然后一口气吐完。这个节奏适合后台任务、批处理、循环调用,不适合你盯着屏幕等它开口的对话。选之前得先想清楚自己要的是哪种。上面那个 6 倍的账,也要按这个打个折。
而且只有一家 API 供应商,没有第二家兜底。这是纯粹的工程风险,和快慢无关。一家挂了就是挂了。
³ "同价位"这个分类本身就是个近似。它按 3:1 的输入输出混合比例划档,可实际使用里,像它这样缓存命中率高的场景,真实比例根本不是 3:1。所以它到底算不算"同价位里定价合理",取决于你怎么用它,不取决于标签。
如果这个判断对,接下来会看到更多模型不做"样样第一",而是往一个极端上站——极端快,或者极端省字,然后去别人的工作流里当零件,不当大脑。
总榜排九十多名的位置,在单模型比高低的时代算失败。在被拼进流水线的时候,未必还是。