自指不是智能的零件
自指是不是智能的必备件,最近被正面答了一次。 月初 Scott Aaronson 在他博客上发了篇长文,标题就叫 LLMs and selfreferentiality。看标题像又一篇聊意识的东西。不是。他通篇在拆一句话:怪圈是智能的核心。 简单说,自指就是一个系统能提到自己。

自指是不是智能的必备件,最近被正面答了一次。 月初 Scott Aaronson 在他博客上发了篇长文,标题就叫 LLMs and selfreferentiality。看标题像又一篇聊意识的东西。不是。他通篇在拆一句话:怪圈是智能的核心。 简单说,自指就是一个系统能提到自己。

「LLM 是不是下一词元预测器」,这问题最近又被拎出来问了一遍。 简单说,这话不算错。它只是把外形说完了,里子一个字没提。 这个月初,Garrin McGoldrick 写了篇文章专门拆它,第二天又改了一版。作者自述是机器学习研究者、软件工程师,再往前是搞粒子物理的。博客上标着"进行中的笔记",看着就是随手记的那种。
上周某个晚上,我本来是去看热闹的。刷到一篇新预印本,标题一眼就知道想搞事——《LargeLanguage Models as a Cognitive Virus》。我心想:哦,又来了一个比喻。真没出息,我还是点进去了。作者九个人,我只认识俩,Michael Levin 和 David Krakauer。

你有没有遇到过那种时刻:你问一个 RAG 系统“这本书讲什么”,它沉默了一会儿,然后非常确信地告诉你——0。 不是“我不知道”,不是“我没找到相关内容”,就是一个干干净净的数字。0。像你问同事“中午吃啥”,他回你一个“1”。信息量约等于零,但自信程度拉满。

模型每一刻只干一件事:给下一个 token 排概率。不是判断对错,不是求新,是问训练分布里哪个 token 最常跟在后面。这个动作重复一百万次,就是你拿到的每一段回复。这篇我们搭一个最小采样器,跑完你就知道“模型把你拽回主流”在代码里长什么样。

八月初 Chris McCormick 写了篇文章,说他不读大语言模型生成的虚构小说。这结论本身我没多大兴趣——现在这类表态满大街都是,早就不好奇了。让我停下来的,是正文前面那行斜体小字:“本文由一位人类撰写。” 这行字有用吗?拦不住谁骂他偏激,也解决不了一丁点语法问题。它唯一的作用,就是先把你的阅读预期换掉。
两周前 arXiv 上挂了一篇隐私保护 RAG 的论文。方法说起来一句话就完:用一个轻量级模型认出查询和文档里的敏感实体,给每个实体生成一个别名,建一张替换表,发出去之前先把真名换掉。 就这样。没有密码学,没有可信执行环境,就是换词。 这个办法土到我的第一反应是不屑。
这周本来没什么动静,直到一篇 arXiv 预印本把我拽住了。8 月 13 日挂出来的,讲 LLM 写形式化规格到底行不行。 规格是什么级别的概念,不展开。写代码的人都知道,代码能跑和代码是对的,是两回事。形式化验证管的是后一件事。验证的前提,是你先把“什么算对”写成机器能检查的精确描述。那个东西就叫规格。

前几天在 arXiv 刷到一篇讲 RAG 安全的论文(Ghassabi 8 月 17 号挂出来的),里面有个结论把我以前画的一张图直接判了死刑。先撂判断:RAG 的坑不在“查”,也不全在“判断”,在一个更别扭的地方——模型看见了假的,认出来了是假的,还是被带偏了。 先画我以前以为的样子: 看着挺合理对吧?

这期先讲一篇论文。别划走,这条和你天天喂文档给 AI 的那件事,是同一件事。 一篇 8 月 17 日挂上 arXiv 的论文,说 RAG 检索回来的资料可能把模型带沟里 论文编号 2608.16515,三位作者,8 月中旬提交的。 核心说法一句话讲清楚:RAG 不是给了证据就万事大吉。

先撂一句:你对“对话上下文”的心智模型,八成是错的。我自己错了好多年。 我一直把上下文想成一条聊天记录。你一句我一句,往下滚,卷轴。聊天界面也一直这么给我看,所以这个错觉从没被戳破过。直到最近玩一个叫 ThoughtDAG 的开源工具,玩到一半我停住了——它把上下文画成图。
为什么 AI 做的重构经常编译不过?这周看到一篇论文,作者没猜原因,是手动一条条数出来的。 拿 10 个开源 Java 项目,让 LLM 去做重构,跑原生测试套件。失败的案例一个个看过去,归类。这种笨办法我喜欢。 数出来的东西挺有意思。失败原因排第一的是上下文误解或幻觉,占 24.3%。

旧稿是这样写的: 请仔细分析这份日志,选择推理深度:低/高/最大。 十六个字。看着没什么问题。"分析日志"是个明确动作,"低/高/最大"是个明确选择。但模型跑出来的结果,三档的边界是糊的——低档输出的东西和高档几乎没区别,全都往"努力分析"上靠。 问题出在【请仔细分析】这五个字上。"仔细"是态度词,不是指令。
未必。 被作者自己撤回的论文,通常不值得写。PolicyGuard 这篇撤回得有点特别——不是造假,不是结论站不住,是机构审查没走完就提交了,作者撤回,说审完再交回来¹。内容本身暂时没人指控有问题,只是时序上不合规。 我关心的不是撤回,是里面一个实验。

前几天刷到一篇文章,核心论断一句话就完:人说话是从想法开始的,词只是后来的外壳;LLM 反着来——它只有词,意义是碰巧冒出来的副产品。 这个对比我第一眼觉得“哦,说得真漂亮”,第二眼觉得哪里不对,第三眼我决定画张图。先别急,从第一眼讲起。 我第一版画的是这样: 两条线,一条从里往外,一条从头到尾没有“里”。

“用 LLM 的世界知识帮强化学习冷启动”这个说法,最近被讲得越来越玄,什么“把常识注入智能体”,听着像给 AI 输血。我的判断:核心机制没那么玄,拆开看就是一次预习。今天画开它。 由头是 ProDVI,今年挂到 arXiv 上的一篇,cs.LG 分类。

第三天改同一个开头的时候我才反应过来。不是它写得不够好,是我一直在替它打工。让它把开头改利索点,它换掉两个形容词;说太温了,它把“值得关注”改成“令人不安”;我干脆火了,说“你给我像个人那样说话”,它来了一句“坦白说,这件事确实透着古怪”。还是不像我。 我把窗口摔在一边,脑子里冒出个问题:它为什么就是学不会我?

『LLM 连个数都数不清』,这话被讲了好几年,讲到现在都快成模型的生理缺陷了。我的判断是:RAG 系统里数错数,锅大半不在模型,在管道。模型只是站在最外面,所以每次都由它背锅。 七月底 dev.to 上有个案例,Rodrigo Diego 写的。我第一眼也以为是“模型数学差”的日常,读完发现根本不是那回事。
几个月前我开始让 LLM 碰我的 MikroTik 设备。先交代一下我的成分:业余网络管理员,给朋友办公室和自己工作室配配路由,真让我考个正经的路由工程师认证,不认真复习肯定过不了。所以每次配新东西,我都是边查 wiki 边配。

速评:LLM 从自然语言生成 CI 配置,完全匹配率最高 3.1%。这不是“还不够好”的问题,是“根本接不住”的问题。 Doc2CI 这篇预印本够狠的。14 个开放权重模型加 GPT4o、GPT4.1,生成了超过 53000 个配置,最高的一致率 3.1%。什么概念?
