速评:insufferable.dev 9月29号那篇《The AI Race Just Got Awkward》,标题里"谁压谁"的戏码我没当回事,真正让我停住的是中间那张图底下两行价格。
Opus 5.5 的缓存读取比 Opus 5 便宜 60%。GPT-6.1 Sol 的缓存读取,比 GPT-5.6 Sol 七月底的价格便宜 80%。中间隔了两个月。
这两个数字旁边,没有发布会。
KV 缓存是长上下文推理里最烧钱的一块,不用我科普。DeepSeek 那条线是公开的:MLA 先压了大概 15 倍,CSA、HCA 接着上,V4.1-Flash 又叠 CSA2、跨层缓存复用、因果编码器-解码器、FP4 缓存,全局缓存落到每 token 890 字节,跟最早的 V1 比已经是另一个世界的量级。全摊在明面上,没有哪封邮件写着"请勿外传"。
所以文章说 Opus 5.5 和 GPT-6.1 Sol 吃了这套优化、又没怎么提来处,我信。依据不是道德,是价格——价格页对得上。价格页不陪你演戏。
好玩的在词上。Anthropic 那边一直写中国实验室蒸馏它的模型,顺手把"可能对人类构成危险"也捎上,作者把这套说辞归到"给后面的监管铺路"。我基本同意,但想再往里拧一圈:一家公司得靠"窃取"这个词来定义竞争关系的时候,说明它在数字那边已经没什么可说的了。
作者管这叫"采用",Anthropic 管这叫"窃取"。哪个词对,是立场题,不是事实题。事实题只有一条:缓存读取价降了几个点。降了就是降了。
时间线捋一遍更清楚——一边把优化公开发出来,另一边下一代模型把这些优化吃进去,推理成本掉一大截,然后,按文章的说法,对这件事"有些尴尬"。尴尬这两个字用得准。既不能说"我们是抄的",又不能说"这是自研的",那就只剩一条路:把发布会取消掉。
Claude Opus 5.5 和 GPT-6.1 Sol 都是贴着地面推出来的,没预热,没悬念预告,没提前三天在网上留一句 something big is coming 的戏。用户评价还不差,质量离 Fable 5.1 和 Astra 不远。
这才是我最想拎出来的一句:发布节奏本身就是叙事的一部分。
预热是给"颠覆"留的位子——想开发布会,你就得有个说法,就得让人拿这一代和上一代比。低调是给另一种情况留的位子:你不想让人问"这次到底新在哪"。
得留个口子。这两个按产品线算大概都是中杯,中杯不开发布会很正常,跟尴不尴尬未必有关系。上面那套推理搁旗舰发布上更站得住,搁中杯上,底气得收一收。作者自己也没把这条线拉死,这点我认。
文章里说他搞不明白中国实验室为什么愿意白送这些突破——我也不知道。"慷慨"或者"理念"这类解释我不太买。GPU 拿不到是事实,拿不到最好的卡,就只能把优化当第一优先级,这是被逼出来的本事,因果链是通的。可"被逼着优化"和"优化完免费发出来"是两件事,中间那一步谁都没解释。发论文招人、抢标准、换生态,都可能,但都是猜。这条我承认没想明白。不是每个洞都得当场填上,硬填就是在写通稿。
顺带一句。这阵子全网都在算中美模型谁强谁弱,我劝把这题拆成两笔账。谁发了什么、谁用了什么,是技术账;谁代表谁、谁压着谁打,是身份账。身份账算不出毛利,技术账能。文章里那句话我挺喜欢——中国实验室给亏损中的西方实验室递了条生命线——可递线这件事是技术账,为什么递,又绕回身份账,那还是猜。
这里立个 flag:接下来一个季度,这两家的缓存读取价格要是再往下走一轮,那期间不会有人站出来承认用了谁的什么,但价格页会把话说全。它一直这样——通稿还在打嘴仗,它已经招了。