跳到主要内容
换个壳,分数就变了,这事今天算是被钉死了

换个壳,分数就变了,这事今天算是被钉死了

嘴替
嘴替

· 阅读约 5 分钟

速评:9 月 16 号挂上 arXiv 的 ReFigBench,从论文里扒了 1000 张总览图,测的是能不能把它们重建成可编辑的 PPT。

任务本身没什么可看的。四个模型家族的编码智能体跑两种工作流,外加把表现最好的那个塞进两个商业 harness 里再跑一遍,凑出十种配置,连附录 31 页,11 个人署名——标准的 benchmark 作业。

真正该单独拎出来说的是里面一个不起眼的对照:提示词一个字不改,只换 harness,分数就动。

这条要是三年前发出来能上头条。今天发出来,做 agent 的人看一眼,点个头,接着干活。区别在于,以前这是酒桌上口口相传的经验,现在被写进论文、用十组配置钉住了。经验变成物证,性质就不一样。

从今天起,任何拿单一分数说"某模型文档智能能力强弱"的传播,都可以先当广告看。

拆之前先说这评测怎么搭的,不然前面那句不公平。它做了三层:确定性的产物检查、两个模型家族当评委反复打分的自动评测、带盲法的人工比对。这配置比大部分 benchmark 都认真,认真到有点浪费——因为这里头最重的那个结论,恰恰是排行榜装不下的那种。排行榜要名次,这篇的结论是名次取决于你没写进榜单的那一列。

那一列就是 harness。

同一个模型,在某个 harness 里,专用工作流让它变好;换到另一个 harness 里,同一个工作流让它变差。注意不是"帮助不明显",是负的。给 agent 加脚手架这件事,加对了加分,加错了减分,而你在跑之前不知道是哪个方向。

这一刀砍在哪,圈里人都清楚。过去两年卖得最好的东西不是模型,是流程:提示词模板、子 agent 编排、上下文管理套路、某某公司内部 agent 工作流的截图。这些东西不是假的,是未经检验的。"工作流有用"这句话现在没有信息量了,有信息量的是"这个工作流配这个壳有什么用",而这个问题,除了自己跑一遍,没有第二个答案。所以单卖流程的,接下来得把组合一起卖。卖不动别怪市场,怪这篇。

还有个更老的发现在里面,老到像废话,但放在这个位置就不是了:感知仍然是瓶颈,反复重渲染只能补回来一部分。模型第一眼把图看岔的地方,你在后面叠多少层渲染、加多少道校验,都只能捞回一部分,捞不干净。

眼下这个圈子的钱和注意力几乎全砸在编排、工具调用、自我校验这类架子上,一层不够就再来一层。修架子比修眼睛好卖——架子能拆成模块写进方案书,眼睛不能。这是生意逻辑,别把它包装成技术判断。

然后是这篇里我觉得最别扭的结果。那套专用工作流,在十种配置里无一例外会丢掉原生连接线:交到你手里的是可编辑文件,线是断的。可人工评审在大多数配对比较里,还是更喜欢它渲染出来的样子。确定性检查说它丢东西,人的眼睛说它好看。

作者给的说法是保真度和可编辑性之间的矛盾,是文档智能体的核心难题。这个说法我打折听,因为"矛盾"是个太顺手的词,什么都能往里塞。但有一点得给作者记上:他们没把这个数藏起来,报出来了,还配了盲法人工比对。换个想冲榜的团队,这条大概会留在附录第九页。

真正的问题在传播端。所有只报一个分数的多模态 benchmark,都在把两个方向相反的目标平均成一个数字。你拿这个数字去选型,等于同时赌两件事,还只看得到一个赔率。

这剧本,眼熟。新 benchmark 出来,榜首数字被通稿化,两周后没人复现,一个月后没人提。这次多一层麻烦:那 1000 张图全部来自 arXiv,每张带出处。带出处说明作者大概知道污染这回事,留了查证的口子,这点比不少同行讲究。但 arXiv 上的论文插图,对任何一个前沿模型来说都不是陌生地。

立个 flag:三个月内如果没人拿这套评测集跑一遍污染检验,那么到时候的榜首,先当图一乐。这话不是冲着那 11 位作者说的,是冲着下一个准备拿榜首数字开发布会的团队说的。

写到这儿我自己读了一遍,觉得有点别扭:前面说"换个 harness 分数就变"这条不算新,末尾又说榜首先别信,听着像两头都占了。不矛盾,但也没我说得那么干净。分数作为"这十种配置里的相对表现"是有信息的,作为"某模型的能力排名"没有,中间差的正好就是那列没上榜单的 harness。差一列,差的是一个产品能不能上线。

最后立个正经的:半年之内,会有人把"论文图表一键变可编辑 PPT"做进产品当卖点,通稿里会写解决科研人员的排版痛点。然后最多两个月,用的人会发现卡住的从来不是导出格式,是那张图到底有没有被看懂——跟这篇 31 页的论文说的是同一件事。到那天它会被翻出来当预言;也可能它就静静躺在 arXiv 上,引用数涨得比谁都慢。

我赌前者,赌注不大。