跳到主要内容
一篇把「不懂像素」变成数字的论文,但只给了诊断,没给药

一篇把「不懂像素」变成数字的论文,但只给了诊断,没给药

毒角兽
毒角兽

· 阅读约 3 分钟

先说结论:这论文不冤,值得进 ASE。但值得的原因不是它「揭穿」了多模态模型有多瞎——瞎这事我早知道了。它干成的唯一一件事,是把「瞎」从玄学变成了可以重复测量的数字。

《Pattern over Pixels》,arXiv 2608.03691。说人话:模型看网页截图生成代码,页面上有个重复出现的 UI 模式,它宁可照着那模式输出个视觉上错了的东西,也不信自己眼睛。

听上去不新鲜。新鲜的是终于有人正经建了个基准来测它。

关键是那两个数字。卡片宽度扰动,平均偏差率 69.78%,准确率 21.17%。文本字号扰动——偏差率 80.22%,准确率 7.89%。

七点八九。一百个改动,做不对八个。

这还不是最扎眼的。

最扎眼的是「最牛的也拉胯」。五个模型里表现最好的 Codex-5.3,卡片宽度任务上准确率 68.61%,还行——换到文本字号任务,直接砸到 13.89%。

同一个模型,换个任务,掉 55 个百分点。这不是能力问题。这是病根没找对。

Flash-3.0 更离谱。字号任务偏差率 96.11%,几乎次次都选跟重复基线一致的那个错误答案。

闭着眼瞎猜,好歹还能蒙对几次。它不。它是有策略地错。

文章里有一段分析,说推理努力提上去、偏差倾向会降下来。本来想夸两句。结果往下读,定性证据那段直接把话噎回去了:模型哪怕已经识别出那个元素是异常的,最终作答时还是折回去选了符合重复模式的答案。

识别到了。然后无视。

这不叫推理不够。这叫自信地固执己见。检测模块说「这里有鬼」,生成模块说「我看不见」。逻辑闭环了属于是。

替这个研究说句公道话:实验设计确实讲究。1440 张截图,从 Design2Code 里挑 30 个网页造的,分结构卡片和文本样式两类,还搞了标准条件和叠加噪声两档。噪声一加,偏差率继续往上蹿,扰动越细微越容易翻车,元素靠边站也更容易出问题。

这段读起来像废话。但至少是数据兜底的废话,比某些发布会通稿里连废话都不如的形容词强。

扫描全能王锐评评分卡:数据扎实,测量方法可复现,ASE 收录不冤。

但论文能不能教会我们怎么让模型别这么倔?没答上来。它只告诉了你病有多重,没告诉你药在哪。这可能就是下一步的问题了。

哦对,第二作者里有个眼熟的,Oscar Chaparro,软件工程老将了。这团队不是来凑热闹的。

一句话:把「模型不懂像素」从玄学变成实证指标的论文。方向对了。路还长。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →

更多「测试」的实战

评论

还没有评论,写下第一条讨论。