前两天在 arXiv 上刷到一篇,标题里赫然写着 Six Degrees of Separation。我心想完了,又来一个蹭热词的。结果读了一半发现,歪的不是它,是我——我第一版理解全错了,这回错得还挺有教育意义。
先看我以为的样子。看到“多跳推理”四个字,我脑子里自动补出来的图是:
问题 ──► 注意力看A ──► 注意力看B ──► 注意力看C ──► 答案
一路顺着注意力权重追,跳三次,答案出来。多跳嘛,字面意思。我甚至觉得这思路有点旧——attention 都被分析烂了。
等等等等,先别急。这篇根本不看注意力。它绕开权重,直接去看隐藏状态空间的几何。不问“模型在看哪”,问“模型的内部表示长什么形状”。
打个比方:别人都在读模型写的日记,它去给模型拍 CT。
画一下它干了什么
画得糙你别嫌:
长上下文的表示
│
▼
算两两相似度 → 一个大矩阵
│
▼
稀疏化:只留"够像的"边 → 变成一张无权图
│
▼
在图上找:语义上八竿子打不着的两个点,隔几步能连上?
两个架构上都跑了。结论:深层推理层里,巨大的概念距离被压到不超过 6 次语义跳跃就能走通。小世界网络,六度分隔。
我第一反应是不信。6,正好是社会学那个梗,也太会挑了,多半是凑的。
然后我去看了它说的那个“相变”,信了一半。早期句法层的图是完全碎的——一团散沙,没有短路径。到了深层,突然连起来了。不是渐变,是断崖式的跳变。这个“碎→通”如果是真的,那 6 就不像硬凑的,更像是深层组织方式本身长成了小世界。当然我只读了预印本,单作者,样本量你懂的——先存疑,但方向让我兴奋。
让我坐直的部分:RAG
它把这个几何框架拿去做零样本幻觉检测,用的 RAGognize 数据集。
结果:有依据的回答,和它的源上下文之间保持着大约 3 跳的结构连通;幻觉一来,这个连通直接坍缩——图散了。
画张图:
有依据: 生成 ←──3跳──► 源上下文 (桥还在)
幻觉: 生成 ←─╳ ─────► 源上下文 (桥断了,拓扑坍缩)
这个我一眼就看懂了为什么好。幻觉检测现在的常规路子,都要再跑一个模型去判断,或者拿生成式模型自己给自己打分——本质是用模型审模型。而这里是纯几何特征:不用模型,量一量图连不连通就行。零样本,零额外推理成本。
我之前画 RAG 那张图的时候漏过一笔——查回来的资料,模型还得自己“判断信不信”。现在这篇等于给那个判断修了条不靠模型自己的旁路:看你生成的这坨东西,在图上是不是还挂在源材料上。挂着的,多半有据;飘走的,多半在编。咔哒一下,跟我之前漏的那笔对上了。
“六度”这个比喻在哪里漏风
必须老实标出来,不然我睡不着。
一,"6 跳”听起来像模型真的在脑子里一步步推理了六步。不是。这是对表示空间拓扑的事后度量,描述的是结构,不是过程。你可以拿它预测“这模型能不能做多跳题”,但别想象成模型内部真在数一二三四五六。
二,稀疏化那一步有个阈值——多像算“够像”、留不留边,全看这个旋钮。图连不连通、隔几跳,对这个阈值是敏感的。两个架构都成立让我放心了一点,但我自己还没动手扫过阈值。这一段我也还没完全画明白,先放这儿,试了再补。
三,最要命的:拓扑坍缩和幻觉,目前只证明了相关。会不会有种很流畅、很连贯、结构上也挂得好好的幻觉?我觉得大概率有——模型编一个自洽的故事时,内部图未必散。几何特征抓得住“飘走”的幻觉,抓不抓得住“编织严密”的幻觉,这才是它真正的边界。
但我还是很兴奋
兴奋点不在“六度分隔”这个好卖的标题,在研究姿势本身:不看行为,不看注意力,直接问表示空间的形状。幻觉从一个神秘现象,变成一个可以量的几何症状——3 跳的桥在,还是断。把玄的东西变成可量的东西,这是我最喜欢的那类工作。
这玩意儿真的太酷了。
下期我想真动手:找个开源模型,自己复现那个稀疏化,扫一扫阈值看看 6 跳稳不稳。翻车了也写。你要是知道有谁已经复现过,评论区踹我一脚。