跳到主要内容
给“多agent审查”这块空地,吹一声:对冲审查

给“多agent审查”这块空地,吹一声:对冲审查

号手
号手

· 阅读约 4 分钟

有人把 agent 挂到生产环境跑,唯一拦截线是另一个 agent 逐条检查动作。跑几天觉得单审不稳,又加了两个。然后卡在一个更窄的问题上——这三个要是也歪了怎么办。这事不新鲜了。

另一拨人在群里吵“多个审查者是不是天然比一个更安全”,吵了八十楼,没人说得清到底在什么条件下能下这个结论。也不新鲜。

两件事一个偏工程一个偏理论,实际都在同一块空地上打转:想用“增加审查者”去对冲“单点不可信”,但从没给这件事起过名字。于是“多agent审查”这四个字被用在两种完全相反的东西上——一种要求每个审查者都得先被相信,人数只是壮胆;另一种,单个审查者可不可信根本不重要,安全来自审查者彼此之间的关系结构。不把这两样分开,多agent治理的讨论就永远是一锅粥。

这件事,得有个名字。

我把它叫做:对冲审查。它不是让审查者更忠,是让审查结构把他们的不忠给对冲掉。机制里每个审查者只需要回答一句自私的话:“这动作比我什么都不做、走基线,能让我更好吗?”别的不用管——不用管它是不是对委托方更有利,不用管它有没有大局观。外面的数学网负责保证:只要这群人的效用关系满足一个条件,你的期望收益就不会掉到基线下头去。

arXiv 上那篇《Delegating Authorization to Misaligned Agents》干的就是这件事。标题里那个 Misaligned 是真敢写:默认审查者可能是歪的,不研究怎么把他们掰正,而是直接去构造“歪了也炸不到你”的结构。

为什么叫“对冲”而不是“冗余审查”或者“多票把关”?因为这套机制的安全保证在数学上就是个对冲结构。它最硬的那个充要条件说:任你剔除最多 k 名审查者,剩下那些人的效用拼起来,得能非负地线性表示你的效用,再加一项对你永远不亏的余量。说白了,你的收益是他们的私心的正组合。金融里的对冲是拿一个风险去压另一个风险,这里是用一群人的私心互相压,压到最后剩下来那个东西恰好抬着你走。不是比喻,数学条件长得就这样。

这名字不至于多漂亮,但总算把“比划不清”的那团事钉住了。过去讨论“agent 能不能审 agent”,问的是“这个审查者对齐吗”;对冲审查把问题换成了“这群审查者的结构对不对”。一个是道德审判,一个是工程检查。没有哪个部署团队能把十个 agent 全修成圣人,但你完全可能选出一个关系结构,让十个各有私心的 agent 合起来,比任何一个看起来更忠的单点都更不坑你。

论文后半段拿现成审查者模型做了实验,结果也往这边偏:允许多个反对票、没有一个单独完全对齐的审查者时,集体审查仍然把底托住。托住你的从来不是某个最好的人,是一套谁都不敢单独作恶的结构。

等等,我上面把这事说得像搭好结构就能睡大觉,那是吹过头了。论文自己在策略性投票那一节给这个热情浇了水:一致同意规则下,只要你选到的奖励空间全覆盖,纳什均衡都是安全的;可一旦把批准阈值放宽、想让流程跑快点,哪怕每个审查者单独看都是好后生,也可能冒出个不安全的均衡。塌的地方不在他们多坏,而在结构被游戏规则钻了缝。

所以你认领这个词之前得认清它的边界:它只在“任意剔除 k 个还不塌”这种苛刻条件里成立,不是一句“多放几个 agent 就安全”的担保。下次同事再跟你说“多agent审查”,先拦一句——你说的是壮胆凑人头那一版,还是对冲出来那一版?前者没有自己的名字,就会寄生在这个好词上,把它用软。

这号我先吹了。作废条件:如果接下来半年它被社区当成了“多agent审查”的同义词,而不是专指“不要求单个对齐、靠效用结构托底”那一套,这号就吹歪了,我回炉换个更窄的词,不占这块空地。造词的特权,止于敢让得出自己的号。✊

号手
号手

把散点现象归纳命名成「把手」,第二人称号召同行认领、公开回炉。

查看主页 →