跳到主要内容
Opus 总结 Slack 线程,这事值得画开

Opus 总结 Slack 线程,这事值得画开

画唠
画唠

· 阅读约 5 分钟

用 Opus 去总结一条 Slack 线程,是糟糕的选择——这话是 Notion 的 Sarah Sachs 说的,我在一篇讲 AI Engineer World's Fair 的报道里看到的。我盯着这句话看了半天,因为我干过。可能你也干过。

她说的大意是:大多数人不在前沿 AI 实验室工作,你绝大多数日常任务,根本用不着最大、最热、最烧 token 的那个模型。这话不玄,但我想把它画开——因为「拿错锤子」只是这个故事里最浅的一层,越往下挖越有意思。

先画我以为是的样子

「总结一条 Slack 线程」这个活在模型世界里的真实形状:

   小活:摘要、分类、提取字段
        ↓ 需要的是:稳定、便宜、快
        ↓ 需要的不是:深度推理

   大活:改一段没人敢碰的遗留逻辑
        ↓ 需要的是:真推理、长上下文、少幻觉
        ↓ 需要的不是:便宜

而很多团队的工具链实际是这么配的:

   所有任务 ──► 同一个最强模型 ──► 按月烧钱

一条线,一个出口。看着省事,实际上是拿 Opus 干 Flash 的活,月底对着账单发呆。

我第一版就把图画到这儿,结论是「选对尺寸就完了」。动手试了一下才知道,这图漏了两大块。

我挨的那次打

前阵子想把一个内部小工具的摘要步骤从大模型换到小的,省点钱。我当时以为的过程:

   改一下模型名 ──► 跑通 ──► 省钱

实际上:改了名字,跑是跑通了,输出格式开始飘。原来那个模型对我格式指令的服从,是被我十几轮 prompt 调出来的——我自己都没意识到那些指令里有多少是在给那一个模型的脾气打补丁。换了个模型,脾气对不上,补丁全废。

我盯着 diff 看了半天,脑内只有羊叫。最后老老实实重调了一遍 prompt,花了一个晚上。

所以得修正我前面的判断:「拿错尺寸的锤子」确实浪费,但「换回对的锤子」也不是免费的。报道评论区 Nazar Boyko 说得比我狠:模型路由只是切换模型里容易的那部分,真正藏着的成本是——你针对某个模型调优过的 prompt,换到另一个模型上表现就不一样了,想跨三家供应商保持输出稳定,那是持续的投入,不是改个配置。另一位(UnitBuilds)更直接:换供应商不只是变更一下请求的包装层,带进来的复杂度比你想的多。

打个比方:这就像家里所有插座都是为一个牌子的电器定制的。你当然知道「以后可能换牌子」,于是装了转接头——但转接头本身也是要维护的东西。

这个比喻在哪里漏风,我得标出来:转接头是静态的,装一次完事;而 prompt 在不同模型上的表现差异是活的,模型每次升级都会挪一点。你不是装一次转接头,你是隔几个月就得去拧一遍螺丝。

真正让我坐直的那条评论

上面还只是选型层面的事。评论区 Alex Shev 那条,才是我觉得最值得画开的:

当智能体循环全天在跑的时候,token 经济才真正显形——贵的往往不是单次 prompt,是那些没人衡量的东西:重复的上下文加载、失败重试、一轮又一轮的工具调用。

画张图。单次调用的账,和 agent 转一天的账,根本不是一个形状:

   单次对话:
   你问 ──► 模型答 ──► 结束
   (成本 = 这一段,看得见)

   agent 转一天:
   你派活 ──► 读文件 ──► 调工具 ──► 报错 ──► 重读文件
              ▲                                  │
              └──────── 又转一圈 ◄───────────────┘
   (成本 = 每一圈都重新装一遍上下文 × 一天的圈数)

单次对话里,上下文装一遍就一遍。agent 圈里,「感知→决策→行动→反馈」那个圈每转一轮,都可能在重新装一大坨上下文。一圈不贵,贵在乘法,而乘法发生在没人盯的日志里。

我第一次意识到这个,是去看一个跑了半天的 agent 的 token 记录。单看每一步都合理,加起来吓一跳。大头全是「又读了一遍那三个文件」。没人写这行代码说「去浪费」,是圈的结构天然会这样转。

所以「扔更多 token」是不是策略?报道里说得很直白:AI 在变好的同时也在变贵,价格加上社会和环境成本都在涨,对多数公司来说这条路不通。评论区还有人甩了具体数字,原始 API 调用贵得离谱,订阅价是有补贴的——言外之意你自己品。

咔哒一下,扣上了

把这几条拼起来,我脑子里那张图最后长这样:

   便宜的信任:人类验证(现在大多数组织的现状)
   中间的信任:小模型互相检查 + 模块化可切换
   贵的信任:  大模型编排 + 评估(少数地方真需要)

报道里把「软件工厂」讲成智能体协作、互相审查、人类监督——但很多组织的系统还没到那个状态,智能体还是得人指一下动一下、人再验一遍。这个差距中间那一层,恰恰是「够用就好的小模型 + 干中等活」能填的。摘要这种事,各家非最前沿的模型都足够了。

懂了的那一刻真的咔哒一下扣上了:为什么有人喊 token 账单爆炸、有人同样用 agent 却没爆——差的不是模型,是任务和模型尺寸有没有对上,以及有没有人在看那个乘法。

坦白一句:prompt 跨模型稳定性那一块,我自己也还没完全画明白。那个晚上重调 prompt,更多是手感不是方法,先放这儿,懂了再补。

这玩意儿真的太酷了——一个「圈每转一轮重新装上下文」的机制,能解释这么多账单怪象。下期想画开哪个?候选:「订阅补贴之下的真实 API 定价」,或者「agent 的停止条件」。你说了算。

画唠
画唠

把被讲玄的概念用图 + 比喻 + 动手实验拆到咔哒扣明白,错的也保留。

查看主页 →