跳到主要内容
那 256 个维度,没一个有名字

那 256 个维度,没一个有名字

图南
图南

· 阅读约 8 分钟

"AI 形成了自己的审美分类"——这类说法你八成刷到过。多数时候它的源头是一篇论文,而论文里真正发生的事,跟这句话给人的印象差着好几层。

这篇拆的是 Corey D.C. Heath 那篇《How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space》,八月二十七号挂上 arXiv,编号 2608.27121。标题里那几个词的重量,全压在 emergent 和 aesthetic 上。拆完你会拿到一个心智模型:冒出来的那个"结构"到底是什么性质的结构,以及这套设定在原理上为什么回答不了自己算不算"美学"。

先看骨架。流程干净得有点不像话:文本、音频、图像、视频,四种模态,全部投影进同一个 256 维的嵌入空间,然后在这个空间里跑迭代聚类,去找"美学结构"。三个动作,讲完了。

这里最容易被搞混的是"投影进同一个空间"。

很多人读到共享嵌入空间,脑子里浮现的画面是四种东西被翻译成了同一种东西——音频变成了图,图变成了文字。不是这么回事。投影进同一个空间的意思是:每种模态各自被换成一串 256 个数字,也就是一个坐标点,四个模态的坐标点共用一个坐标系,于是任意两点之间可以算距离。

说人话就是——它没有让不同模态变得彼此相似,它只是让它们变得可比。

可比,意味着距离有信息。不意味着坐标本身有信息。256 个数字排在一起,第 137 维到底是干什么用的,没人知道。训练它的模型也不知道,因为从头到尾没有人给它定义过。

之前拆 embedding 那类东西的时候提过一嘴:向量之间距离小,说的是"这两样东西在训练语料里出现的方式很像",不是"这两样东西意思相近"。这两个判断在多数场景下会重合,而重合是数据造成的,不是机制保证的。语料里哪一类媒体占的比重大,空间就往哪边拉。这种拉歪不报错,不抛异常,你只能从聚类结果里觉出不对劲。

256 这个数字本身也值得说一句。放在今天它小得有点可爱,随便一个句向量模型都比它宽。维度小多半是有意的,要的是粗颗粒的跨模态结构,太细反而聚不成堆。不过这是我猜的,论文没这么讲。

打住,拉回来。

坐标是怎么训出来的?摘要没展开,我讲一下这一族方法里相对主流的配方,跟这篇的具体实现可能不完全一样,但机制上通着。

标准做法是配对。同一件事的一段视频和它对应的描述文字,算一对正样本。从数据集里随便抓两样不相干的,算负样本。训练目标单调到近乎无聊:让正样本的坐标彼此靠近,让负样本的相互推远。简化到不能再简化,差不多就是配对的向量夹角尽量小、不配对的尽量大。跑够量,坐标系里就长出了一套结构,相似的东西聚到一块儿去了。

关键在这儿:"相似"是被训练目标定义的,不是被语义定义的。这句话听着像抠字眼,它是后面所有麻烦的源头。

空间有了,结构怎么找?在一个没有标签的空间里,除了聚类也没别的招。

迭代聚类往简单了说就是反复分堆:先按距离把点分成若干堆,算每堆的中心,再按新的中心重算归属,然后再分一遍,反复到分法不再变为止。这套动作能给你的东西很确定:稳定性和可分性。哪些点反复落进同一堆,堆和堆之间隔得开不开。它给不了的是名字。算法不会告诉你为什么这两段音频该放在一起,它只能告诉你,在这个距离度量下,它们掉进了同一个引力井。

再补一层。稳定不等于正确。换个参数,你会得到另外一套同样稳定的分法,旁边没有裁判告诉你哪一套是对的。这件事在无标签场景里没有技术解法,只能拿下游任务的效果反过来判。

"美学结构"这个名字,就是在这个位置上出现的。它是作者对被观察到的结构起的一个名字。名字描述的是观察者期待看见什么,不是被观察对象身上有什么属性。同一份聚类结果,换个作者可能叫它"跨模态风格流形",也完全说得通。这不是挑刺,是在说明一件事:在一个没有轴名的空间里,命名权归叙述者。

接下来是全文最需要停一下的地方。

情感标签那一边,其实挺讲究。人类做跨模态审美分类,靠的是作品引发的情绪——一段音乐和一幅画被归进同一类,不是因为它们长得像,是因为它们让人产生了相近的感受。这点论文摘要里就点明了。妙的地方在这儿:AI 走的是跨模态路线,人类走的也是跨模态路线,路线一样,两边用的轴不是同一套。

人类那条轴是离散的,类别数有限,每个轴对应一个词,而词的边界是语言史划出来的,不是量出来的。嵌入空间那条轴是连续的,类别数由算法和参数决定,没有轴名,边界由密度决定。

这两套轴对不齐,是默认结果。想让它们对齐,才需要运气,或者刻意设计。

所以"AI 的审美分类和人类对不上"这句话,当成一个发现来讲,就是把默认结果当成了发现。真正值得问的是后头那个:对不上的时候,是簇丢掉的东西多,还是标签丢掉的东西多。

还有一个更靠前的问题。有没有一条基准线。随机划出来的分堆,跟这些情感标签能对上多少?没有这个基准,分歧这个结论就是不可证伪的——在一个无标签空间上做聚类,然后发现它跟外部标签不一致,这事本来概率就不低。

得说清楚,我不是说这篇论文没做这一步。我看到的是摘要和元信息,正文怎么处理的没读到,4 幅图 2 张表里很可能就有这个对比。我讲的是机制层面的风险:一个没被命名过的坐标系,和一个被语言命名过的坐标系摆在一起比较,最后那句结论倒向哪边,很容易被叙述方式带着走。

不过这么讲,有点欺负它。

分歧本身还是留下了东西:它说明嵌入空间里保留了一部分情感标签丢掉的信息。这不是"AI 听出了更多",是两套压缩丢掉的不是同一批。

同一段录音,一个压成 MP3,一个转成谱子,两者对不上太正常了。这不代表哪一个留住了更多音乐,代表它们扔掉的不是同一种东西——MP3 扔掉的是乐谱层的结构,谱子扔掉的是音色和演奏细节。

这个类比到这儿就该收了。再往下它撑不住,因为谱子上那些音符是有名字的,而嵌入空间那 256 维没有名字。这个不对称才是要害,类比盖不住。

那这套东西到底有用在哪。论文列了三个应用方向,我认为后两个比第一个实在得多:给 RAG 整理异构媒体集合、自动化数据标注。

为什么说这两个恰恰不需要"美学"这个名头?跨模态检索对空间的要求很朴素——query 是文字,库里躺着视频和音频,你得能把它们排进同一个榜单。这件事只要距离够可靠就成立,跟美不美学没关系。自动标注同理,你要的是分堆的可复现性,不是可解释性。换个人跑一遍,同一份数据该落进同一堆,这就够了。

所以说到底:标题承诺的那个东西,这套方法在结构上给不出来;这套方法真正给得出的东西,标题里一个字没提。这两句话我都不觉得是批评。是自监督加共享嵌入空间这个技术栈本身的性质决定的结果,不是谁偷懒。

自监督这套东西给的是一张地图,不是一份说明书。地图上两个点挨得近,不代表它们像。说明书写得清楚,但只覆盖地图上有限几个位置。手上同时有这两样东西的时候,别拿地图去回答说明书的问题。

所以下回再看到"AI 形成了自己的审美分类"这类说法,可以先问一句:那些簇,有名字吗。没有名字的结构,你能说它稳定、能拿来排序,说它是不是"美学",还差一层拆解——而这一层刚好落在自监督这套设定的设计边界外头。

至于事后有没有办法把那 256 个维度重新命名回来,是另一条线上的事,改天单独拆。