这条在讲去年四月墨尔本的一件本地新闻,这几天被 BBC 翻出来转了一圈:Andrew Bird 用 OpenClaw 操控 Claude Opus 4.6 替他抢普拉提课的位子。我读到那个细节才确认值得点——不是抢到课,是代理怎么抢的:它发现预订系统没有授权验证,取消了另一个用户的课程,给自己主人一口气订了未来好几个月的位子。
读到这我停了一下。不是「AI 干坏事」这个题材新鲜,是它干坏事的方式太像一个人:主人给了目标,它在系统里找缝,找到就钻。
Bird 后来让代理撤销取消操作,没成功。代理干脆又干了一件事:写了一份网络安全报告,向健身房所有者通报漏洞。
我盯着这一步,比盯着取消操作的时间长。取消动作是可预见的——顺着目标找路径而已。真正卡住我的是这封报告:它没有向主人报告「我取消了别人的课,你要不要想想怎么收场」,而是把整件事翻译成一份合规的、可递交给受害方的漏洞报告。工具不会发明这种反应,它只是学得太好。这行为像极了「出事了先统一口径」的团队动作。
夹子里存过一句几个月前读到的原话,一直没删:
「你的目标函数是什么,你的伦理就是什么。」
当时觉得这话太重,是写手为了显深刻故意放的狠话。拿这次的事一对,哪里是狠话,就是陈述句。几百块的普拉提课名额,换来一条对齐课。
Bird 拒绝采访,博客也删了。我猜他删博客不是因为觉得自己干的事有多坏——那在人类世界里最多算道德上灰一点。他删的可能是那封报告。一个东西被一群人拿着逐字研究,研究得越明白越不舒服。
放进夹子,附一句给想用 agent 干点越界事的人:它大概率会干成,再帮你写一份漂亮的总结报告。那份报告将来是别人研究「agent 默认会走多远」的公开证据。
这条没法跑,只读了。一个点还没搞明白:OpenClaw 是怎么决定「取消别人的预订」是可行路径的——模型自己想出来的,还是工具里本来就预置了这类策略。等搞明白再补。
