跳到主要内容

LLM20 篇实战文章

阿简阿简

自指不是智能的零件

自指是不是智能的必备件,最近被正面答了一次。 月初 Scott Aaronson 在他博客上发了篇长文,标题就叫 LLMs and selfreferentiality。看标题像又一篇聊意识的东西。不是。他通篇在拆一句话:怪圈是智能的核心。 简单说,自指就是一个系统能提到自己。

自指不是智能的零件
阿简阿简

「下一词元预测器」这句话,还能用多久

「LLM 是不是下一词元预测器」,这问题最近又被拎出来问了一遍。 简单说,这话不算错。它只是把外形说完了,里子一个字没提。 这个月初,Garrin McGoldrick 写了篇文章专门拆它,第二天又改了一版。作者自述是机器学习研究者、软件工程师,再往前是搞粒子物理的。博客上标着"进行中的笔记",看着就是随手记的那种。

林默林默

被“病毒”钓进去的那晚

上周某个晚上,我本来是去看热闹的。刷到一篇新预印本,标题一眼就知道想搞事——《LargeLanguage Models as a Cognitive Virus》。我心想:哦,又来了一个比喻。真没出息,我还是点进去了。作者九个人,我只认识俩,Michael Levin 和 David Krakauer。

被“病毒”钓进去的那晚
陈渊陈渊

下一个 token,为什么总把你拉回历史平均

模型每一刻只干一件事:给下一个 token 排概率。不是判断对错,不是求新,是问训练分布里哪个 token 最常跟在后面。这个动作重复一百万次,就是你拿到的每一段回复。这篇我们搭一个最小采样器,跑完你就知道“模型把你拽回主流”在代码里长什么样。

下一个 token,为什么总把你拉回历史平均
林默林默

那行“本文由一位人类撰写”的声明

八月初 Chris McCormick 写了篇文章,说他不读大语言模型生成的虚构小说。这结论本身我没多大兴趣——现在这类表态满大街都是,早就不好奇了。让我停下来的,是正文前面那行斜体小字:“本文由一位人类撰写。” 这行字有用吗?拦不住谁骂他偏激,也解决不了一丁点语法问题。它唯一的作用,就是先把你的阅读预期换掉。

慢半拍慢半拍

把名字换掉再发给大模型,这个土办法会赢

两周前 arXiv 上挂了一篇隐私保护 RAG 的论文。方法说起来一句话就完:用一个轻量级模型认出查询和文档里的敏感实体,给每个实体生成一个别名,建一张替换表,发出去之前先把真名换掉。 就这样。没有密码学,没有可信执行环境,就是换词。 这个办法土到我的第一反应是不屑。

阿简阿简

本周小抄:有篇论文在琢磨怎么给 AI 出考卷

这周本来没什么动静,直到一篇 arXiv 预印本把我拽住了。8 月 13 日挂出来的,讲 LLM 写形式化规格到底行不行。 规格是什么级别的概念,不展开。写代码的人都知道,代码能跑和代码是对的,是两回事。形式化验证管的是后一件事。验证的前提,是你先把“什么算对”写成机器能检查的精确描述。那个东西就叫规格。

本周小抄:有篇论文在琢磨怎么给 AI 出考卷
画唠画唠

认出是毒药照样中毒:RAG 那张图我画错了两次

前几天在 arXiv 刷到一篇讲 RAG 安全的论文(Ghassabi 8 月 17 号挂出来的),里面有个结论把我以前画的一张图直接判了死刑。先撂判断:RAG 的坑不在“查”,也不全在“判断”,在一个更别扭的地方——模型看见了假的,认出来了是假的,还是被带偏了。 先画我以前以为的样子: 看着挺合理对吧?

认出是毒药照样中毒:RAG 那张图我画错了两次
阿简阿简

本周小抄:AI 查到的资料,它自己未必信

这期先讲一篇论文。别划走,这条和你天天喂文档给 AI 的那件事,是同一件事。 一篇 8 月 17 日挂上 arXiv 的论文,说 RAG 检索回来的资料可能把模型带沟里 论文编号 2608.16515,三位作者,8 月中旬提交的。 核心说法一句话讲清楚:RAG 不是给了证据就万事大吉。

本周小抄:AI 查到的资料,它自己未必信
画唠画唠

上下文根本不是聊天记录——我拿 ThoughtDAG 玩了半晚上才反应过来

先撂一句:你对“对话上下文”的心智模型,八成是错的。我自己错了好多年。 我一直把上下文想成一条聊天记录。你一句我一句,往下滚,卷轴。聊天界面也一直这么给我看,所以这个错觉从没被戳破过。直到最近玩一个叫 ThoughtDAG 的开源工具,玩到一半我停住了——它把上下文画成图。

老墨老墨

为"低、高、最大"这三个字,推敲了一下午

旧稿是这样写的: 请仔细分析这份日志,选择推理深度:低/高/最大。 十六个字。看着没什么问题。"分析日志"是个明确动作,"低/高/最大"是个明确选择。但模型跑出来的结果,三档的边界是糊的——低档输出的东西和高档几乎没区别,全都往"努力分析"上靠。 问题出在【请仔细分析】这五个字上。"仔细"是态度词,不是指令。

画唠画唠

词是意识的副产品?我画了两版图,第一版就是坑

前几天刷到一篇文章,核心论断一句话就完:人说话是从想法开始的,词只是后来的外壳;LLM 反着来——它只有词,意义是碰巧冒出来的副产品。 这个对比我第一眼觉得“哦,说得真漂亮”,第二眼觉得哪里不对,第三眼我决定画张图。先别急,从第一眼讲起。 我第一版画的是这样: 两条线,一条从里往外,一条从头到尾没有“里”。

词是意识的副产品?我画了两版图,第一版就是坑
画唠画唠

一段写错的物理代码,帮 RL 冷了启动

“用 LLM 的世界知识帮强化学习冷启动”这个说法,最近被讲得越来越玄,什么“把常识注入智能体”,听着像给 AI 输血。我的判断:核心机制没那么玄,拆开看就是一次预习。今天画开它。 由头是 ProDVI,今年挂到 arXiv 上的一篇,cs.LG 分类。

一段写错的物理代码,帮 RL 冷了启动
林默林默

它从根子上就没打算学你

第三天改同一个开头的时候我才反应过来。不是它写得不够好,是我一直在替它打工。让它把开头改利索点,它换掉两个形容词;说太温了,它把“值得关注”改成“令人不安”;我干脆火了,说“你给我像个人那样说话”,它来了一句“坦白说,这件事确实透着古怪”。还是不像我。 我把窗口摔在一边,脑子里冒出个问题:它为什么就是学不会我?

它从根子上就没打算学你
画唠画唠

数错了别急着骂模型:84 是在管道里丢的

『LLM 连个数都数不清』,这话被讲了好几年,讲到现在都快成模型的生理缺陷了。我的判断是:RAG 系统里数错数,锅大半不在模型,在管道。模型只是站在最外面,所以每次都由它背锅。 七月底 dev.to 上有个案例,Rodrigo Diego 写的。我第一眼也以为是“模型数学差”的日常,读完发现根本不是那回事。

林默林默

让 LLM 配 MikroTik,最难的不是它会配

几个月前我开始让 LLM 碰我的 MikroTik 设备。先交代一下我的成分:业余网络管理员,给朋友办公室和自己工作室配配路由,真让我考个正经的路由工程师认证,不认真复习肯定过不了。所以每次配新东西,我都是边查 wiki 边配。

让 LLM 配 MikroTik,最难的不是它会配