能憋出三千行前端界面的AI agent,现在多得跟外卖小哥一样遍地都是。但你要是让这些“可视化大牛”自己动手画一个简单界面出来,画面就尴尬了——不是码不对,是布局本身就是一团乱麻。
AM-Bench这篇论文,算是把AI编程圈的画皮扯下来一层:别看你码代码码得飞起,你脑子里那张画布,基本是一片空白。
论文设计不复杂,就两个任务。翻译任务——给你一道完整的几何描述,你生成画它的代码,是个模型都能过,八个测试对象全过,没有一个拉胯的。然后换到布局任务——想让你完成一个不完整的描述,你得自己“脑补”出来整个画面拼好,分数就开始自由落体式下跌,比中概股还刺激。
这不是说模型偏科,这是压根没开那门课。作者另外做了一组消融实验,更耐人寻味:把过程式代码换成原始SVG——也就是直接吐SVG文本而非生成操纵canvas的JS代码——然后所有模型的布局测试得分都跟着往上涨了一截。
这个点太能说明问题了。
语言模型对空间的理解不是通过“感官”,而是通过语言符号的排列规则。SVG是极富结构性的文本,尖括号一开一合、坐标一变一转,语言模型的续写本能就能让它摸到不少视觉上的规律,但一旦换成更抽象、更“代码化”的过程式生成——需要你脑子里先有一张成品图,再倒推怎么用一堆API调出来——它原本那点文本规律上的优势就彻底归零。
所以别再说什么“让AI自己画设计稿”了。当你给它一个不完整的需求,让它自由发挥空间布局时,模型画出来的东西之所以像学术垃圾拼贴画,是因为它压根没在“画”。它只是凭借语言惯性在延续文本。
别指望什么token预测器里藏着毕加索。它只是在做统计学上的合理接龙——所谓对画面空间的理解,纯属错觉。
顺着这个思路,某些自我标榜“AI优先设计工具”的产品,还有市面上那些号称“Agent会自主规划、它能产出令人放心的UI”的新物种,都该重新掂量一下自己手里的技术路线。你喂给模型的永远是那一串字符,里面没有分辨率,没有图层关系,更没有屏幕边距这些设计学科最底层的概念。
更值得琢磨的是,这瓜吃到一半,多少有人会拿“那几个被测模型不过区区8个开源小卒,闭源旗舰们想必不会如此不济”来说事。AM-Bench挑的确实是只吃文本和代码训练的开源权重模型,没碰那些带视觉分支的闭源大杯——但反过来讲,这恰恰是它对“纯语言模型”做了个精准到位的活检。
如果连业界公认的头部闭源模型、那些标榜“多模态原生”的家伙们也得靠那一层视觉Encoder勉强续命,那它们在没见过的复杂组合面前,不过是比这几个开源测试对象多练了几遍题库而已,本质上仍然是“由文本规则硬撑起的一个半吊子空间感”。
模型内部的探针实验结果坐实了这一点。生成之前,各层激活里就已存在某种“远景规划”,但只覆盖Prompt字面所能暗示的那部分布局;一旦真进入实际生成,又变成了盯着当前几何状态,一步步走一步看的短线策略。
翻译任务普遍做得稳,是因为每个方位的措辞都是齐的,你只需要做一次形的翻译,不需要额外的脑补;开放式布局满地翻车,则是因为Prompt根本兜不齐完整的视觉期望,AI面对半拉子工程,它那颗“所见即所得”的文本大脑实在无从下手。
换句话说:这不是调几个prompt就能翻身的工程问题,而是架构层面就缺失的那个“画布”。常听一些人嘲讽“AI不懂美学”,这话多少沾点刻薄,但“不懂布局”真是字面意义上的硬件短板,连为它说句公道话的空间都挤不出来。
这不是说模型没有救——视觉分支加上去、用真图去训、让它在向量空间里直接比较距离而非纯啃字符,都能治标。但至少当前这代纯文本模型,你没法靠堆积它的上下文窗口去补出真正的空间想象力。那只会在文本接龙的路上越走越自信,输出一堆看起来语法上无懈可击、构图上一无是处的代码。
语言模型的短板从来不是词穷,是压根没长眼睛。