读 CursorBench 3.2,前五名那几分当平手看
· 阅读约 4 分钟
这篇不搭工具,搭一套怎么看榜单的方法。上周把 CursorBench 3.2 来回翻了几轮,值得看的就两类东西:主分那一列,和每次任务的平均成本那一列,其余是装饰。
开搞之前先确认你手里有真问题——是要给 agent 选型拍板,还是想找个参照价。没有的话,这榜看了也白看,热闹看完留不下东西。有的话,咱们开始。
Step 1:主分当分布看,别当排名看
前五名拿出来:Fable 5 Max 70.5,Opus 5 Max 70.0,Opus 5 Extra High 69.3,Fable 5 Extra High 68.4,GPT-5.6 Sol Max 67.2。
先别激动。这五个数字挨得有多近?0.5 到 1.1 个百分点。Cursor 自己标了,这个基准有随机波动,较小的分数差异可能不具备统计显著性。说白了:第一名到第五名,大概率是同一个水平线上的五个采样点,谁站上面取决于抽卡手气。
那排名真没用?有,看断层。前五名开外跌到哪、底部那个 37.6 站在哪,比谁第一值得读。哪家分数掉到 50 以下,从“工具人”到“陪跑”的分界线就划出来了。
这一列还有处疑点:Grok 4.5 没上榜。Cursor 说过,自己训练数据里含 Cursor 代码库的早期快照,基准分被污染了,未来模型已移除这部分数据——那 4.5 本身呢?处理得干不干净,无从考证。只能判断这张榜把自己踩过的坑处理过一遍,具体处理到哪一步,外人看不见。
到这里,验证你读对了没有:能把前五名的分数差说成“平手”,这步就过了。
Step 2:成本列才是把分数拉进预算的通道
第二列是每次任务平均成本,第三列 token 消耗量,第四列执行步骤数。大多数人扫一眼主分就关门,这三列才是真金白银。我纠结过要不要把 token 那列单独展开讲,后来想明白了:光看 token 数没用,乘上价格才算数,所以只讲成本。
成本列怎么算的:各模型公布的每百万 token 定价(输入、缓存读取、缓存写入、输出分开算),乘实际消耗的 token 数累加。听着严整,坑在定价是变数。3.2 发布当天(7 月 8 日)更新过 GPT-5.6 三个配置的结果,把缓存写入的成本补进去了;7 月 30 号又更新了 Terra 和 Luna,说是反映调整后的定价。意思很直白:眼前这张表的成本列,是按今天的定价重算过的。拿它去报价,要留余量——这是当日码头价,不是合同锁定价,模型说调就调。
⚠️ 这一步很多人会卡在拿不准性价比:均价最便宜的那个,执行步骤数可能反而最多。这俩放一起怎么挑,我的排序是:先看步骤数,再看成本列。团队工时比电费贵,模型省下的 token 钱,撑不过工程师多调一小时的班。看反了,容易被省钱的幻觉套牢。
对了,版本号这个细节是我写到后面才想起来必须提前交代的,插播一下:核一眼榜单右上角是不是 3.2。3.0 的任务是代码编辑、重构、修 bug,3.2 加了指令遵循和高级工具使用,考的不是一套卷子。朋友圈转发的“XX 登顶”截图,先看角落里的版本号再转,别把老成绩当新榜炒。
Step 3:把分数换算成你的动作
榜单读完,能背出前十名不叫会看。管用的动作是这几条:
- 业务里大量多文件改动的 dirty work,挑统计上同一档、执行步骤更少的配置;
- 跑长流程的 agent,盯 Extra High 和 Max 的档位差——有的模型升档后得分涨不到 3 个百分点,成本涨快一半,这笔账按你业务的量自己算一遍,比官方宣传页好使;
- 特别吃“按指令办事”的场景,去翻 3.2 新增的指令遵循子任务描述,总分的 0.5% 不值得纠结。
基准只能拿真实用户会话的模糊问题来测,跟你的理想操作之间隔着一条沟。它回答不了“我的项目选谁”,只负责告诉你“谁在 benchmark 上打得过”。剩下的,由你的成本、延时和用途说了算。
到这里,这份榜单能榨的就榨干了。这套读榜方法跑起来了吗,照这个自查:
- 能说出前五名之间的差距为什么不是排名差距,而是随机波动
- 能说清成本列怎么算的,以及它为什么随时会变
- 能指出版本号是哪一版,以及主分该按分布看还是按排名看
都打勾了,这份榜单就只欠你的业务数据。下次更新别急着转前十名惊呼,先对一遍成本列,省下的时间够你多调一轮 prompt。
更多「Cursor」的实战
评论(1)
版本号那点后面还有啥?我也老看榜单但没想这么细。