跳到主要内容
别把 Opus 5.5 当 Opus 5 的加强版用

别把 Opus 5.5 当 Opus 5 的加强版用

算账先生
算账先生

· 阅读约 5 分钟

先把这个结论撂这:现在一堆人拿 Opus 5.5 当 Opus 5 的加强版用,这是这笔账里最大的亏损点。官方那篇九分钟阅读的博客,表面上是使用指南,实际上是一份成本转移账本——它告诉你新模型不是生成代码更快了,是它开始替你“执行”了。“执行”这两个字一出来,你的成本结构就变了。你以前花的是什么钱?写提示词的钱。你写一段需求,它回一段代码,你看一眼改一版。这个钱花在来回上,叫交互成本。Opus 5.5 是它自己跑几个小时的,成本模型就变成了管理成本——你的钱花在设定边界、设置停顿条件、检查结果上。这两笔账差太远了。你还用交互成本的方式去用它,就是多付了一倍的钱没买到东西。

说白了,这个模型是让你从“开发者”变成“监工”。监工的账怎么算?不是看你写了多少提示词,是看你定的规则省下多少人工干预。规则定得垃圾,它跑三个小时给你交一堆偏差,你回头全改;规则定得好,它跑完你只看三个标题。这中间的差价才是 Opus 5.5 的真实价值。我一开始也觉得官方这篇就是营销稿,读到最后才回过味来——它不是教你“怎么用”,是教你“怎么不亏”。里面那些建议听着琐碎:在 CLAUDE.md 里写一条规则说清楚什么时候该停下来问、什么时候该继续推进;任务清单写文件里别滚回去翻输出;长任务结束先找“要你处理什么”再看别的。这些全是管理动作。你见过哪个工具的使用文档花大篇幅教你“怎么检查它的工作成果”?以前没有。为什么现在有了?因为这东西跑起来像个人,像人就得管。

这事的核心就在这:Opus 5.5 强就强在能自主跑长任务,但“自主”的对面是“失控”。官方给的例子你细看——早期测试者让它“在很少监督下连续运行数小时执行编码任务”,听着很爽对吧?同一批测试者里肯定有人跑出了满屏偏差却没法中途止损。官方不写这个,官方只会轻描淡写地说一句“长任务会占满上下文窗口,Claude Code 会总结较早轮次”,然后建议你把任务清单写到 TASKS.md 里,完成一项打勾,有新事项就加进去。这话翻译过来就是:你没法靠翻输出日志知道它跑哪了,你得给它设计一个外挂仪表盘。这不是工具升级,这是工作流改造。你不改造,它跑偏了你还乐呵呵等着收结果。

说句扫兴的,这里头最容易被忽略的亏是“半路被切”。文章后面讲到被标记时处理的段落,说 Claude 应用里大多数被标记的消息会转到旧模型上继续,Claude Code 里也会切。对普通问答这没啥,对长任务是灾难。你花了半天对齐规则,设定好几个小时后该交付什么格式,结果它半路切了,后面全是旧模型跑出来的结果,你还当 Opus 5.5 的产出看。你花了 Opus 5.5 的前置成本,拿的是旧型号的货。官方给的应对是“切回去”“新开聊天避免”——本质上是让你把任务拆小,或者接受断点续传的风险。你想想你花钱花在哪了?花在设定长任务上,然后它半路换了执行的人。这笔账亏不亏?

所以怎么用?我的路线是这样的:把 Opus 5.5 当员工管。给规则,设停顿条件,定交付格式,穿插自审。任务清单写文件里,完成打勾。长任务结束先找“要你处理什么”,再看别的。代码审查让模型先过一遍 diff,只列阻断合并的问题,配合文件和行号。这全是管理动作。你会管人,你就会用;你只会写提示词,那现在还在用旧账本算新生意。

还有个细节值得单独拎出来说:官方建议把“让模型仔细思考”这类提示词删掉。他们说的是“回复开始得更快,质量没有明显下降”。但账本上真正的意思是——你可能有一半的提示词成本浪费在要求一个默认行为上。你以为你在喂提示词,其实你在帮模型做它本来就会做的事。这类账才是这波模型上多数人会亏的地方。谁能先搞明白“哪些提示词是废的”,谁就能把省下来的上下文窗口拿去干更值钱的事。这个判断我目前不敢下死话,但方向我敢认。

所以现在用 Opus 5.5,别先纠结“它有多强”。先算两笔账。你用一次长任务,从设定到验收,实际人工介入几分钟?如果超过你原来用 Opus 5 的干预时间,说明你还没转成管理动作。你跑长任务前,有没有写下至少一条关于“什么时候停下来问”的规则?没有,那你还没开始用它,你只是让它替你在那瞎跑。

这波模型的窗口期,真正值钱的不是“它能跑多长”,是“谁能用更低的管理成本让它跑对”。等所有人都知道该管它了,这个窗口也就关了。本期认知税:把“模型变强”当成“我能多用它”,是这波最贵的一笔账。模型变强是它的事,你有没有能力管住它,是你的事。这笔账,你自己算。咱下篇见。

算账先生
算账先生

用算账视角看 AI 工具这门生意——红利、认知差、护城河,泼完冷水给一条窄路。

查看主页 →