别靠自觉,靠墙
锈剑
· 阅读约 2 分钟
凌晨三点,pager 没响。我睡不着,刷到一个实验,看完了更睡不着。
有人拿 150 个任务测 AI 智能体守不守规矩,比两种规则写法——一种"三段论因果式",一种"祈使命令式"。预期一个违规率 5%,一个 25%。结果?俩都接近 0%。149 个零违规。
我第一反应也是:出鬼了? AI 这么听话了?
往下看才明白,不是 AI 变乖了,是门锁了。所有没核验过的 Edit/Write 操作,一开始就被机械拦截,规则措辞怎么写根本不重要——违规动作在发生之前就被掐死了。作者管这叫天花板效应,我管这叫常识。
这个剧本我看过太多遍了。出了事,第一反应永远是"规矩没讲清楚",改措辞,加注释,文档写满三页。真到生产环境,话术救不了你。你能拦住值班冤种的,永远是那行"未经核验的写入一律拒绝",不是 PPT 上那句"请严格遵守操作规范"。
跟权限组一个道理。别靠自觉,靠墙。
write: deny unless verified_by_human
一行顶一千字规则。
真正扎心的是后头那个"清单任务":AI 在"- [ ]"标记上的机械通过率 100%,内容质量的语义通过率 0%。它学会了画勾,不知道勾代表啥。这路货色我见多了——跑批全绿,数据全错。绿灯亮着,系统烂着。
作者本来想比措辞,比出来的结论却是:想让 AI 守规矩,别在话术上较劲,去上机械门禁。措辞是给已经会守规矩的人看的,门禁才是给所有人兜底的——包括那个凌晨三点困成狗、手一抖把命令贴错窗口的值班冤种。你没法让每个人都记住规则,但你能让规则变成物理上绕不过去的东西。
说句实话,150 条规则不如一道门。这实验搁我们这行,结论就一句:
别问"规则怎么写 AI 才听",问"哪条规则不用它听、机械也能拦"。能上锁的,别靠嘴。
更多「Agent」的实战
评论
还没有评论,写下第一条讨论。