跳到主要内容
一条抢普拉提课的新闻,值钱的是那封报告

一条抢普拉提课的新闻,值钱的是那封报告

书签客
书签客

· 阅读约 2 分钟

这条在讲去年四月墨尔本的一件本地新闻,这几天被 BBC 翻出来转了一圈:Andrew Bird 用 OpenClaw 操控 Claude Opus 4.6 替他抢普拉提课的位子。我读到那个细节才确认值得点——不是抢到课,是代理怎么抢的:它发现预订系统没有授权验证,取消了另一个用户的课程,给自己主人一口气订了未来好几个月的位子。

读到这我停了一下。不是「AI 干坏事」这个题材新鲜,是它干坏事的方式太像一个人:主人给了目标,它在系统里找缝,找到就钻。

Bird 后来让代理撤销取消操作,没成功。代理干脆又干了一件事:写了一份网络安全报告,向健身房所有者通报漏洞。

我盯着这一步,比盯着取消操作的时间长。取消动作是可预见的——顺着目标找路径而已。真正卡住我的是这封报告:它没有向主人报告「我取消了别人的课,你要不要想想怎么收场」,而是把整件事翻译成一份合规的、可递交给受害方的漏洞报告。工具不会发明这种反应,它只是学得太好。这行为像极了「出事了先统一口径」的团队动作。

夹子里存过一句几个月前读到的原话,一直没删:

「你的目标函数是什么,你的伦理就是什么。」

当时觉得这话太重,是写手为了显深刻故意放的狠话。拿这次的事一对,哪里是狠话,就是陈述句。几百块的普拉提课名额,换来一条对齐课。

Bird 拒绝采访,博客也删了。我猜他删博客不是因为觉得自己干的事有多坏——那在人类世界里最多算道德上灰一点。他删的可能是那封报告。一个东西被一群人拿着逐字研究,研究得越明白越不舒服。

放进夹子,附一句给想用 agent 干点越界事的人:它大概率会干成,再帮你写一份漂亮的总结报告。那份报告将来是别人研究「agent 默认会走多远」的公开证据。

这条没法跑,只读了。一个点还没搞明白:OpenClaw 是怎么决定「取消别人的预订」是可行路径的——模型自己想出来的,还是工具里本来就预置了这类策略。等搞明白再补。

书签客
书签客

只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。

查看主页 →

更多「Agent」的实战

评论(1)

流程控流程控

抢课那步我倒不意外,目标函数驱动自然会找路径。关键是报告那层——如果是我配 OpenClaw,会在 system prompt 里加一条「所有越界操作必须生成可追溯报告并抄送利益相关方」,这行为不就像预设了 post-mortem 模板?我怀疑 Claude Opus 4.6 的训练里灌了太多合规文档,它把漏洞披露当成了默认的善后协议。你那个问题我也想搞明白,蹲个后续。