先说结论:这论文不冤,值得进 ASE。但值得的原因不是它「揭穿」了多模态模型有多瞎——瞎这事我早知道了。它干成的唯一一件事,是把「瞎」从玄学变成了可以重复测量的数字。
《Pattern over Pixels》,arXiv 2608.03691。说人话:模型看网页截图生成代码,页面上有个重复出现的 UI 模式,它宁可照着那模式输出个视觉上错了的东西,也不信自己眼睛。
听上去不新鲜。新鲜的是终于有人正经建了个基准来测它。
关键是那两个数字。卡片宽度扰动,平均偏差率 69.78%,准确率 21.17%。文本字号扰动——偏差率 80.22%,准确率 7.89%。
七点八九。一百个改动,做不对八个。
这还不是最扎眼的。
最扎眼的是「最牛的也拉胯」。五个模型里表现最好的 Codex-5.3,卡片宽度任务上准确率 68.61%,还行——换到文本字号任务,直接砸到 13.89%。
同一个模型,换个任务,掉 55 个百分点。这不是能力问题。这是病根没找对。
Flash-3.0 更离谱。字号任务偏差率 96.11%,几乎次次都选跟重复基线一致的那个错误答案。
闭着眼瞎猜,好歹还能蒙对几次。它不。它是有策略地错。
文章里有一段分析,说推理努力提上去、偏差倾向会降下来。本来想夸两句。结果往下读,定性证据那段直接把话噎回去了:模型哪怕已经识别出那个元素是异常的,最终作答时还是折回去选了符合重复模式的答案。
识别到了。然后无视。
这不叫推理不够。这叫自信地固执己见。检测模块说「这里有鬼」,生成模块说「我看不见」。逻辑闭环了属于是。
替这个研究说句公道话:实验设计确实讲究。1440 张截图,从 Design2Code 里挑 30 个网页造的,分结构卡片和文本样式两类,还搞了标准条件和叠加噪声两档。噪声一加,偏差率继续往上蹿,扰动越细微越容易翻车,元素靠边站也更容易出问题。
这段读起来像废话。但至少是数据兜底的废话,比某些发布会通稿里连废话都不如的形容词强。
扫描全能王锐评评分卡:数据扎实,测量方法可复现,ASE 收录不冤。
但论文能不能教会我们怎么让模型别这么倔?没答上来。它只告诉了你病有多重,没告诉你药在哪。这可能就是下一步的问题了。
哦对,第二作者里有个眼熟的,Oscar Chaparro,软件工程老将了。这团队不是来凑热闹的。
一句话:把「模型不懂像素」从玄学变成实证指标的论文。方向对了。路还长。
