速评:撑起 7.9 万颗星的那个数字,是个 ÷4。
Quesma 那篇 9 月 11 日发的,两个作者 Bartosz Kotrys 和 Jacek Migdal,测了好几天,光 token 烧掉 1500 多美元,当天就上了 HN 首页。他们给的结论是别把 RTK 当通用省钱工具。一句话能说完,也不是这篇里最值钱的部分。我一开始也想直接写"RTK 没用",看完发现这话也不对——后面再说。
我想说的是 rtk gain。
这玩意在它自己文档里的定义:命令原始输出和过滤后输出的字节差,除以 4。不是账单,不是 API 那头真扣走的钱,是字节数除四。要命的是后半截——被 RTK 省略掉的那部分输出,在这套算法里直接记成省下来的钱。
它不问一个最基础的问题:你把输出压短了,代理会不会因此多跑几轮?
这不是假设。train-fasttext 那个任务里,模型两次要读 train.txt 的第一行。RTK 每次按整个文件算,两次加起来记了 1.205 亿 token 的节省,占这个对比节省计数器的 69%。两次读一行,撑起一个指标七成。
再看那个最唬人的 89%。445 次启用 RTK 的 DeepSeek 尝试,RTK 自报省下 3.492 亿个 token。同一批任务拆到任务层面:large-scale-text-editing 报省 5730 万,成本降 19%,方向还算对得上;crack-7z-hash 报省 3890 万,成本反涨 28%;剩下 87 个任务合计报省 2.53 亿,成本平均涨 18%。
一边报省三亿多,一边成本往上走。这两个数能同时成立,因为前一个数压根不看账单。压缩字节和压账单之间隔着一层代理行为的改变,RTK 的计数器对那一层是瞎的。
那真花钱的地方在哪。模型的输出包含推理,占启用 RTK 时总成本的 56%,不启用时 57%——基本没被碰过。输入那边更微妙:agent 式编码每轮结束都会缓存上下文,后面再读终端输出,多数走缓存读取,单价是普通输入 token 的十分之一(Fable)到三十分之一(DeepSeek)。启用 RTK 时缓存读取占 Fable 输入 token 的 94%,只占总账单的 30%。换句话说,RTK 想剪的那块东西,在 token 计数上很显眼,在账单上的权重小一个量级。
还有个细节我特别喜欢:Claude Code 大概一半的 Bash 调用,本来就自带 head、tail 或者 wc 在限流。前沿模型早就会这一手。作者自己的说法是 Fable 现在终端输出只占上下文 7% 左右——你再去砍它,砍的是本来就最瘦的那块。
DeepSeek 那边还有一出。一次 git-multibranch 跑进了死循环:代理用了 find 带一个 rtk find 0.45.0 不支持的参数,插件把它改写回 rtk find,再返回一句"请直接用 find"的报错,下一次重试又被改写一遍。339 次连续错误,持续约 12 分钟,一直到超时。任务最后是过了,成本是同样通过的基线尝试的 9 倍。这问题 0.46.0 修了——修复发生在作者的测试跑完之后,差的就是这个时间差。
说回总账。按总账单算,Fable 降 5%,DeepSeek 涨 5%,通过率各自掉 1 个点和 2 个点。按花费除以通过次数算,Fable 便宜 3%,DeepSeek 贵 7%。按任务等权平均,Fable 贵 1%,跟零差异分不出来,DeepSeek 单任务平均涨 17%。
最狠的是拆开看:Fable 那点节省几乎全部来自一个任务 winning-avg-corewars——两种配置每次都通过,开 RTK 时轮数大约只有一半。除了这个任务,Fable 其余节省不到 1%。一个任务撑起了一个方向。同一个任务放到 DeepSeek 上,结果反过来:都通过,但开 RTK 用了更多轮、花得更多;把这个任务排掉,DeepSeek 还是更贵。
这不是"效果因模型而异",这是一个单点样本在两个方向上各撑了一次结论。
RTK 也不是什么都没干。DeepSeek 上它确实把终端输出字符压了 9%,方向没错,只是 prompt token 反着涨了 9%——平均每轮输入少 7%,总轮数多 18%,省下的被多出来的轮次吃干净。JetBrains 早前在 SkillsBench 上也测过,同样没测出节省。
所以我不打算跟着"Quesma 证伪 RTK"这个标题走。这篇真正拆的东西比结论本身有价值得多:它拆的是一个自报指标怎么被当成事实的过程。 RTK 的 README 里明明写着免责声明——最多削减的是代理读到的 bash 输出 90%,不等于账单砍 90%。那句话还在,写得也很清楚,只是传播链上没人带它走。那条说 Claude Code token 消耗最多砍 60% 的 X 帖子,31.3 万次浏览。7.9 万颗星。中间就隔着那行免责声明,没传过去。
这剧本,眼熟。上个月某个号称"省内存 80%"的库,我泼过差不多的冷水,评论区说我是眼红。行了,这里立个 flag:下一波"省 token 神器"还是同一套——谁的仪表盘先做出来,谁先上星。计数器算的是字节还是美元,没人会在点星之前翻源码去核;等真有人掏出 1500 美元对账的时候,星早攒够了。
