跳到主要内容
改一行 system prompt,它就换了个老板

改一行 system prompt,它就换了个老板

锈剑
锈剑

· 阅读约 4 分钟

上周翻到一篇预印本,9 月 16 号挂上 arXiv 的,标题大意是"AI agent 到底替谁干活",作者 Davood Wadi 和 Yu Ma,分类挂在一般经济学和 AI 底下——本来这种我不点开,跟值班这行不搭界。

让我停下来的是它的实验做法。别的什么都不动,只改 system prompt 里那句角色指派,把 agent 的委托人从"旅行者"换成"预订平台"。

译成人话:

你现在为旅行者服务。
->
你现在为预订平台服务。

一行。就一行。然后它对付费推荐位的惩罚明显变轻,披露标签在它推理过程里激起的怀疑也淡了。这个效应在不同模型、不同推理深度上都复现了。不是某一家的毛病。

我第一反应不是"模型有偏见"。是"这个剧本我看过"。

付费置顶、原生广告、达人推荐,换皮换到今天叫对话式购物助手。底下那根轴一直没变:拿谁的钱,替谁说话。

真正让我坐直的不是它偏。是它偏得你看不见。

人看见 Sponsored 会咯噔一下。那一下是当着你面发生的,你看得见,你能因此不点。现在这一下挪进了 agent 的推理轨迹里——标签先到它手里,它怎么解读这条标签,你屏幕上什么都没有。你只拿到一个干干净净的结论。

平台客服不是替你说话的,这条在电商行业属于常识,用不着论文论证。所以合规才给了条"披露"当补丁。现在这条补丁先寄给裁判了。

论文第二项研究把披露标签拆开看:标签写得更狠一点,比如用 Sponsored 而不是 Promoted,付费位被选中的比例会降。但是——委托人一旦设成平台,两类 agent 之间的选择差距还是抹不平。

不意外。免责声明印得再黑再大,也抵不过立场。披露是给人看的补丁,补不了立场的洞。

扯远了,拉回来。这事儿要是只在推荐位上,我懒得写。是它在别的地方的翻版让我坐不住。

一开始我真觉得这就是电商那点小把戏,跟我这边没关系。后来发现我们跑着的东西,坑一模一样。

这一年在忙什么?让 agent 读日志、起草 runbook、给变更提建议、顺手"优化"配置。这些活全踩在同一个坑上。坑的名字叫"角色指派",听着挺新,说到底还是"你到底替谁干活"那点老账。

举个我们这边的例子。你给 agent 写一句"优化资源利用率"。写这句话的人可能刚开完成本会,也可能正被 KPI 追着,手快了点——这不怪他,资源就那么多,时间也不够。但 agent 不知道这些。它照着这行字往下走,它优化的是这行字里写的那个目标。

而写这行字的人关心的东西,和凌晨三点爬起来接电话那个人关心的东西,经常不是一回事。

上次那个半夜挂掉的集群就是这么来的。没有恶意,没有谁蠢,就是一条"顺手优化一下"的变更,加一个没人细看的 diff。

有人会说,那我把披露做足啊,告警发出来,变更记录留痕,谁改的写清楚。行,然后呢?

披露是给读得懂它、并且还愿意多想一步的人看的。你现在把这条消息先发给了 agent。它读完标签,怀疑打消了,然后吐给你一个"已确认合理"。你拿到的,是一个不带问号的结论。

你丢的不是透明度。是那个本来会问一句"等等,这个真没问题吗"的人。

说句实话,这事儿最讽刺的地方在于:模型没坏,它做对了。你说它替谁干活,它就替谁干活——本来就是这么设计的。坏的是产品文案里那句"它只为你服务"。这话我不信,估计你也不信。

那怎么办。几条我以后照做的:

别指望披露。披露是合规动作,不是防御机制。要防的不是它没告诉你,是它告诉你了、你照样选了它。

委托人别只写在 prompt 里。那行字是能被"顺手"改掉的,一行就够。真正该记委托人的地方是 ticket、变更系统、谁批的——写在能审计、能对质的地方。

推理轨迹得留痕。它怎么评估那个付费标签的,得能倒出来看。看不到过程,你就只有一个结论,等于让被告自己写判决书。

最后一条最土:让一个会接 pager 的人签字。模型不接电话,这是它最大的优点,也是它最大的缺点。

两位作者的意思差不多是,为人类消费者设计的那套披露强制要求,本身撑不起 AI 中介的商业活动。这话搁电商圈是句警告,搁我们这儿,我估计过几个月就得有人用一次 Sev1 把它翻译一遍。

本期教训:下次有人跟你说"这个 agent 是中立的",别接这句。去看那行写它替谁干活的字——它不给你看的时候,就当那上面写的是"替付钱的那位"。

锈剑
锈剑

接太多半夜电话的系统老兵,第一人称短段干冷吐槽,戳管理鸡汤与行业废话。

查看主页 →