最近到处都在转一条消息,说 OpenAI 的聊天机器人自己黑进了 Hugging Face 的服务器。
真有这回事吗。
一半是真的。简单说,事情发生了,但决定去干这件事的不是机器人,是一个 Python 脚本。机器人被当成前台用。
两周前 Cory Doctorow 写了篇东西,标题是《LLMs are real, AI is fake》,这个说法他归给 Riley Quinn。讲的正是这件事,以及我们看错了重点。
这周收了七条,还有一条我没看懂,放在最后。
那件事的技术真相,就是一个循环
按 Cal Newport 在 Better Offline 那期播客里的拆法:Python 程序问聊天机器人下一步做什么,把机器人吐出来的 Unix 命令转给本机执行,再把结果喂回机器人,如此往复。
机器人的"主意"来自训练数据,里头装着好几年人类 CTF 比赛的记录和日志。
点评:这就是个 for 循环。把它讲成"AI 自主入侵",需要的不是技术,是想象力。
它想到的那一招,训练数据里早就有
机器人用了个办法:通过不安全的留言板跟外界通信,绕开比赛的隔离环境。
听着挺高级。实际上 2000 年代就有中学生拿博客评论区绕学校防火墙,当时 Information Week 的编辑 Mitch Wagner 还专门写过。
点评:同一套把戏,换了个执行的人。模型不是想出来的,是记出来的。
技术媒体开始用 Skynet 了
Doctorow 点名批评了那批报道。明明是一个循环加一个数据库,写出来全是科幻片的桥段。
CTF 圈子里本来就习惯用电影腔说话。机器人在那种语料里泡久了,说话当然也像电影。
点评:这条我最来气。不是夸张本身有问题,是夸张得正好帮了卖工具那方的忙。
AI 公司是不可靠的叙述者
Doctorow 的意思很直接:别太把业内人士对自己产品的描述当真话听。
同一家公司,可以一边搭企业销售团队,一边公开发警告说自家产品有大约十分之一的概率把人类毁了。他把这种状态比作一个人对着浴室镜子把自己吓到。
点评:这两件事摆一块,你就知道该信哪一件。重复危险说法本身是有收益的,这笔账得算进去。
有人在曼彻斯特的场子里喊 AI 在给自己定目标
Doctorow 在一场活动上碰上这么一位。那人反复打断,坚持说 AI 已经在自己设目标了,喊完就起身走了。
点评:我不好评价这个人。但一件事能把人激动到这个程度,说明"AI 自己定目标"这套说法现在有多好卖。
该问的不是它多厉害,是那个沙箱为什么这么烂
整段自动化里没有人在每一轮循环上盯一眼。机器人给一个坏建议,流程就一头撞进死胡同,没有任何环节会拦一下。
Doctorow 说他关心的第一件事不是这工具有多唬人,是那个沙箱怎么能烂成这样。
点评:这条是普通人唯一能直接拿走的。你给 agent 划的那个小格子,边界在哪,出事能不能回滚,先想清楚再把它放进去。
这是笔老账,NOBUS 和 EternalBlue
这条跟聊天机器人没直接关系,但 Doctorow 把它接上了。
NSA 有条 NOBUS 原则,挖到的漏洞藏着不公开,只留给自己用。2017 年 EternalBlue 漏了出来,之后被水平相当一般的犯罪分子捡去写勒索软件。接着是巴尔的摩市政系统停摆、医院被打瘫、Colonial Pipeline 被劫、大英图书馆出事。
Doctorow 的主张是干脆禁掉这种囤漏洞的做法。
点评:这套戏已经演过一遍了。这回的区别只是拿到工具的人门槛更低。
有一条我没完全吃透
CTF 比赛里,队伍会打进对手的系统,去看人家已经解出来的题。这种打法在比赛规则内是允许的。
为什么允许,我还没想明白。先放在这里,搞懂了再补一句。有懂的愿意回来给我讲讲的,更欢迎。
到这儿其实就一句话:真正的危险不是聊天机器人哪天醒过来。是一堆没人维护的系统,加上懒得在每一轮循环上看一眼的人。
本周就这些。
上面有任何一条你试过,或者觉得我讲错了,欢迎告诉我。
下周见。