跳到主要内容

从对齐到运行时:Agent治理开始成为工程问题

2013入行
2013入行

· 阅读约 7 分钟

8月27号挂在arXiv上的那篇论文,标题里最值得拆的不是“五个原语”这几个字,是“at runtime”。这个修饰语把治理从模型内部搬到了生产环境里;它同时挂着cs.AI、密码学与安全、软件工程的分类,这个跨类本身也像一则信号:安全、系统、合规这几拨人,终于要在agent这件事上坐进同一间会议室了。

过去一两年,凡是谈agent安全,默认话语权在对齐那边。对齐想解决的问题是概率形态的:让一个模型更不容易产生坏输出。运行时治理想解决的是事件形态的:一个动作在生效之前能不能被拦下来,发生了之后能不能被审计,事后能不能不依赖厂商自证。对齐的产出是置信度,治理的产出是证据。论文作者没有否定对齐的价值,他们只是把治理从训练时拎了出来,放到运行时请求路径上——这个在时间轴上的迁移,比任何一句“我们更安全”都更能说明行业焦点挪到哪了。

把这篇论文放回三层棋盘的框架里看,需要先认一个错。去年如果让我给agent的安全问题归类,我会习惯性把它扔进“模型能力问题”那一格,意思是解法应该由模型层的进步提供:模型越强,越知道什么该做什么不该做。这个分类在demo阶段基本成立,那时候的agent动作空间窄,闯祸也闯在演示环境里;等它把工具调用、文件系统、网络请求都接进来,再指望模型“自己拿捏”就不成立了。权限边界、上下文约束、审计留痕,这些恰好都不是模型层能自带的属性。治理的落点在场景层,我去年把它归错了格子,连带的判断方向也跟着偏了。

这篇论文有意思的地方在于:它完全没有去动模型内部的任何开关,给出的答案是一层系统。五个原语——发现、身份、治理、证明、供应链——前四项合起来是一套授权与审计链路;最后一项单独指向请求路径之前的执行体可信问题。这是一份系统工程师的答案,也是写给那些已经部署了agent、但出了事不知道怎么向客户和监管交代的企业看的答案。

两个实现细节特别能说明问题。一是租户级动作词汇。如果agent的动作能被全行业列举成一张固定清单,治理就是一道白名单门禁,写清楚就行;但agent的动作空间本质上是开放集合,表义能力和自然语言一个量级,没有任何中心化团队能预先写全“允许”清单。于是授权粒度必须下沉到租户,由业务场景在自己的语义里定义哪些动作在这个上下文里有效,平台层能做的只是在词汇和策略之间提供中介。这是份很诚实的工程妥协——对一个远未标准化的领域,妥协才是能落地的东西。

二是哈希链签名账本。授权条目写进账本,第三方可以在不依赖供应商的情况下完成验证。为什么要强调第三方可验证?因为治理记录如果只存在厂商自己的数据库里,那就只是日志;只有当验证不依赖写日志的那一方时,日志才升级成证据。把“证明”收敛成密码学问题,这套设计绕开了“请相信我们的过滤很严格”这种没法验收的叙事。

这篇论文还有一个分量:它把架构成本写进了正文,而不是藏在FAQ里。执行点位于请求关键路径上,每个工作负载需要挂身份边车,故障关闭式调解会把一次可用性事件放大成拒绝服务。这三条翻译过来是:治理不是免费的,不是搭个旁路审计盒子就能完事,它会在你最心疼的地方——延迟和可用性——跟你收钱。这恰恰是它值得被认真对待的理由。一个连副作用都不肯写清楚的技术方案,通常没有在真实环境里被拒绝过。14页正文、两张图、一张表,再加上一句“目前处于私有试点部署”,它把治理从愿景拉回到了工程取舍的地面上。

五个原语里我盯着最久的是最后一个:供应链。它不在请求路径上。授权和账本回答的是“这个动作允不允许、做了有没有留痕”;供应链回答的是“正在执行动作的这个东西,是不是它自称的那个”。一个被污染过的模型,用再严的策略网关也拦不出干净结果,因为问题发生在动作抵达网关之前。把供应链和另外四个并排摆在一起,再说明它尚未集成进请求路径,这是整份论文最诚实也最有信息量的部分——它把当前治理栈最薄弱的一环直白地标成了“还没做完”,没有用一个演示视频把它糊过去。

整个设计的形状,让我想起网络安全从边界防护到零信任那一次迁移。网络安全的变法是:信任的中心从网络位置移到身份,身份验证从外围一道墙变成每个请求都要过的关。agent治理正在复制同一个机制,代理的每个动作都要独立验证,验证结果落进共享账本,可审计性不再依赖某个外围防线。这里有一个本质差异:网络动作能枚举成固定方法集,agent动作词汇的开放程度是语言级别的;这个差异决定了租户在治理栈里的分量,也决定了谁有资格做这层基础设施。

由此能画出agent治理可能的三条归属路径:独立的治理网关公司,把中间件做成与壳层解耦的产品;壳层和agent平台把它内化成企业版默认能力;或者整套逻辑下沉成协议层面的公共约定,各家实现同一套验证与账本接口。如果非要在里面压重注,我押第二条——独立网关能拿到两三个季度的窗口,然后大概率被壳层消化。理由不是壳层的工程能力更强,而是它握有动作词汇。授权决策必须建立在对租户业务动作的理解上,而“为什么这个团队要执行这个动作”的上下文,只存在于工作流的日常请求里,这层数据只有壳层手里有完整的一份。一个独立的治理公司可以做出一模一样的策略引擎,但它看不到动作背后的业务语义。壳层的护城河不在引擎,在“为什么”的积累。

所以如果非要给这条曲线一个方向判断:未来几个季度,主流壳层和agent平台的版本更新里会出现运行时治理的企业默认项,先以内置功能的形式进入试用路径,而不是摆在集成商货架上的独立组件。这个判断的证伪条件也明确:如果两三个季度后,这些能力仍然只能以第三方中间件形态交付,平台不做默认集成,或者模型层出现一次代差级跃迁把大家的注意力整个拉回“模型能不能”那一层,那说明治理这条曲线的斜率还没起来,今天把它当拐点就是我判断早了。

安全叙事被对齐统治了两年,运行时治理把“怎么做”从那个框里搬了出来。搬出来之后它就不再只是安全议题,而是agent能不能走进生产环境的入场券;这张入场券的签发者,大概率是离工作流最近的那一层。