先把这个结论撂这:这场让四个前沿模型拿着同一盒彩色铅笔比谁画得像的测试,真正值得算的账,不是谁 SSIM 高、谁画得讨喜,而是谁在干一堆看起来很努力、实际上对最终结果没有半点贡献的事。Claude Fable 5 七幅画烧掉一百六十美元,平均一幅十二分半,光蒙娜丽莎就反反复复看了 27 次画布,最后得分 0.286,还输给只花了七块七、平均不到七分钟出图的 GPT-5.6 Sol。这笔账一摆出来,什么“Claude 更谨慎”“更擅长用工具”的叙事,就都成了账面幻觉。
说句扫兴的,这类测试从第一天起就不该被当能力榜看。文章作者自己是清醒的,他说得很明白:不是客观能力测试,是开放式、模糊的任务,他继续跑是因为有意思、能提供信息。问题不在这句话,在于外界总是忍不住把它读成一个排名——谁第一谁第二,然后输出一堆大词。SSIM 只衡量结构相似度,连作者本人的眼睛都承认,Gemini 3.6 Flash 那张蒙娜丽莎看着并不像分数那么接近目标。这错位我不多讲,懂的人看一眼指标定义就明白。真正让我想把这事写出来的,是调用日志里藏着的账。
先按七个画作的平均数,把四家的账本摊开。GPT-5.6 Sol 平均 29 步、340 万 token、7.74 美元;Claude Fable 5 平均 54 步、1460 万 token、160.58 美元;Grok 4.5 平均 99 步、3400 万 token、9.21 美元;Gemini 3.6 Flash 平均 73 步、2770 万 token、12.87 美元。这个排列已经够说明问题。烧 token 最多的是 Grok,花的钱却几乎和 Sol 差不多,因为它约 98% 是缓存读取,而且费率最低。Claude 呢,token 量不是最多的,但单价贵,最后成本甩出别人一条街。什么意思?在长任务里,单价和缓存命中率才是成本的决定因素,token 消耗本身可能是个安慰剂——你以为“消耗越多、干得越多”,账不是这么算的。
再看 Claude 的调用明细,那才叫不忍直视。它总共 smudge 了 123 次,平均每幅 15.6 次自我检查。蒙娜丽莎那张它查了 27 次画布,但相似度大约在第五次检查之后基本就不再提升了。为什么多出来的那 22 次查看是白干?因为它每看一次画布,系统就重新按目标图评一次分,分数在平台期之后一直原地打转,最后还掉了一点。换句话说,那些多出来的 view_canvas 和 smudge,不是质量控制,是模型没有“收手”机制。你以为那是谨慎,其实是沉没成本在人工智能身上的最新表现。谁买单?用长上下文代理跑业务的人买单。
GPT-5.6 Sol 刚好是另一个极端。它从头到尾没调用 set_color、set_brush、set_pressure,而是在每次 draw 调用里直接内联设参数,所以平均 29 步就画完。Grok 4.5 则正好反过来,1349 次工具调用里约 65% 是这三个 set_* 调参动作,平均 99 步,一堆步骤就耗在反复设颜色、笔宽、压力上。它烧了最多的 token,产出却最差——作者自己的评价是它很少产出可用结果,频繁工具调用不足以让人信任它对视觉输出的理解。这俩放在一起,能看出一件平时榜单上永远不会告诉你的事:工具使用习惯本身就是成本结构。GPT 选了一条少调用、多内联的路,Grok 选了一条多调用、反复调参的路,结果是一个又便宜又讨喜,一个便宜但基本不可用。模型能力是一笔账,工具设计又是一笔账,两笔账叠加起来才是最终你看到的总花费和总质量。
再说 Gemini 3.6 Flash 的波动。它最常看画布,平均每幅 22.6 次 view_canvas,占近三分之一调用。蒙娜丽莎那张它拿到了全场最高的最佳 SSIM——0.449,但最后收在 0.337。从最佳到最终,它是四家里波动最大的。这个现象细想很反直觉:看最多的人,不是最稳定的那个,反而把自己的高光时刻改没了。注意,这不是 Gemini 一家的问题。文章里说八个有目标图的运行,最终画作得分全部低于运行中途达到的最佳得分。“全部”这两个字太狠了。四个模型都在某一刻画出了比最终结果更好的东西,然后亲手把它改坏了。这说明在开放式视觉任务里,这些模型的自我修改机制根本没有在收敛,它只是在同一张画布上持续消耗预算。这事一旦挪到 agent 应用里,就是生产环境里最难看的一种故障:不是结果差,是结果先好后坏,你根本来不及踩刹车。
还有一条得单独说,因为今年这类论调太多了。作者提了一嘴:更便宜的开源权重模型在这类任务里没法替代前沿模型,有几个试过的甚至只返回空白画布。放在九月份听,挺扎心。圈子里“开源已经追平闭源”的说法喊了有一阵子,一到这种开放、多工具、长程的任务,差距立马现形。原因不复杂:那些便宜模型在 benchmark 上刷的是一问一答,遇到这种要自己拆解任务、长链条操作、反复用工具的场景,短板全露出来。所以下次再有人跟你说开源闭源差距不大,你别急着点头,先问一句:在什么任务上不大?在这类任务上,空白画布已经给出了答案。
那怎么办?不是让你也去跑一遍画画。这种画布测试最大的价值不在能力排名,在成本结构和行为审计。如果你未来要把这几个模型接到任何长期跑、多工具调用的 agent 原型里,这份数据比大多数榜单有用得多。它把你将来可能在生产环境里烧的钱,提前按一定比例预演了一遍。你可以在正式部署前就发现:某模型成本高出一个数量级但产出不提升;某模型看着便宜,其实是缓存命中率在撑着;某模型越检查越坏事。这些在刷榜里永远不会出现。
但我也给自己泼一句冷水:别拿七幅画去给一个模型定终身。样本太小,任务又太偏,作者自己都说是开放式模糊任务,不是能力测试。我下任何关于“哪个模型更强”的死话都不可靠。要不是这堆调用记录暴露的问题太有代表性,我甚至不想多费口舌。这个判断我目前不敢下死话,再看看。
今年这类趣味评测会越来越多。真正该被问住的,不是“哪个画得像”,而是那些看起来很勤奋的调用,到底是在逼近目标,还是在填补沉默的空白。这份测试最值钱的也不是那 28 幅画,是那些调用日志——账本免费发出来了,读得懂的人没几个。
本期认知税:看到模型画画,先关注谁贵谁便宜、却不看贵的那些钱花在了哪一步,是最典型的一种看热闹式复盘。这笔账,你自己算。咱下篇见。