今天跑 Diagram-MMU 被一个结果卡住了,顺手记一下。这个基准 8 月中旬挂上 arXiv,3,700 张人工精选的科学图表,18,300 道人工验证过的题,六个学科。我本来只是想测一下手头模型读图的能力,结果发现真正有意思的不在问答那一档,而在两个图表到代码的任务上。这篇就记这一条主线:为什么「看懂了」和「能还原出来」中间隔着一条比想象中宽的沟。
先拆开看看它考什么。三个任务:图表到代码解析、图表到代码编辑、图表问答,每个任务还各有一个 agentic 设置的版本。解析是给模型一张图,让它把图还原成可执行的代码;编辑是在还原的基础上再改;问答就是常规的看图答题。论文评了 12 个多模态模型,最扎眼的结论是:图表到代码类比问答难得多——模型回答「哪条曲线峰值更高」这种问题答得还行,让它把这张图用代码画出来,就明显露怯了。
我第一反应是「这不意料之中吗」,自己跑了一遍才觉得没那么简单。我拿一张自己画的折线图去试,模型对图的内容描述得头头是道,几条线、图例、坐标范围都说对了,但生成的代码跑出来的图和原图对不上:坐标轴刻度偏了一截,图例位置也不对。也就是说,它「理解」的部分和它「还原」的部分是脱节的。这跟 vibe coding 里那个老问题是同一件事的两种长相——模型能生成一段能跑的代码,不代表这段代码真的对应它声称在做的事。看不懂的输出不能用,而这里「看懂」的标准要更高一层:不光要读懂代码,还要能核对代码和原图是不是一回事。这一步没法省,diff 看着再干净,跟原图一比就现形。
然后是 agentic 设置那部分,这里有个反直觉的点。给了代理能力之后,大多数模型在解析和编辑上确实涨了,但问答反而掉了。我一开始没搞懂为什么工具变多、能力变强,最基础的那档反而退步,后来想了一下,大概是代理流程引入了更多中间步骤,每一步都是一次出错的机会,问答这种本来一步就能答对的任务,被流程拖长了反而容易偏。这个机制我没去深挖论文里的分析,只是自己的猜测,先记在这里,下次有类似现象再回来对照。
唯一一个在三个任务上都持续变好的是 Claude-4.6 Opus,论文里特别点了出来。我不太想把这个直接当成选模型的依据——单一基准上的第一名,换个数据集可能就换人了——但它至少说明「代理化之后问答掉分」不是铁律,是有模型能躲开的。躲开靠什么是论文没讲透的地方,也是我接下来想自己试的方向:同样的代理设置,把中间步骤打印出来对比,看看掉分的模型到底在哪一步开始跑偏。
💡 小技巧:如果你也想拿这个基准跑一遍,建议从解析任务入手而不是问答。问答分数高,跑完没什么感觉;解析任务一跑,模型能力的边界立刻显形,而且失败样本特别适合留着当以后测试的固定用例。我自己留了三张它画不对的图,比任何榜单分数都直观。
FAQ 一条,也是我绕了两次才躲开的坑:别把「问答分数高」当成「图表理解没问题」的证据。这次 12 个模型的数据摆在一起看就很清楚,问答和解析的相关性没有想象中那么紧,一个模型完全可以问答接近满分、解析一塌糊涂。如果你要评估模型能不能接「看图重绘」这类活儿,只测问答会得出过于乐观的结论,至少要补一个还原类的任务,哪怕自己手搓几张图也行。
划重点:第一,图表理解要拆成「看懂」和「还原」两档来测,只测前一档会高估模型;第二,加代理能力不是免费午餐,解析涨分的同时问答可能掉,掉不掉、掉多少因模型而异;第三,失败样本比成功样本值钱,留着能当长期测试用例。这篇就记到这里,项目页面和论文都在 arXiv 上(DOI: 10.48550/arXiv.2608.12262),你可以自己挑几张图跑一遍,如果发现哪一步和我记的对不上,欢迎回来留言,我一起补一条笔记。