跳到主要内容

给 agent 照个 ASTELD 的 X 光,看它偏科偏在哪

Kevin
Kevin

· 阅读约 4 分钟

这篇咱们干一件事:拿 ASTELD 那个六轴框架,给你正在用的 agent 做一次分类体检。半小时以内,跑完你手里会多一份填好的六轴档案,能直接看清这工具偏科偏在哪、它面前有个什么坑。开搞之前不需要代码基础,拿张纸、开个备忘录都行。

开搞之前先确认,你要有一样东西:

  • 一个你正在用的 agent / 工作流 / 工具,哪怕只是个跑在本地的小脚本

没有的话现在去翻一个出来,这篇全程拿它当解剖对象。顺便说一句,上周 arXiv 上那篇 ASTELD 的论文我刷到就看了,四十页,用了三遍。价值不在论文里,在你能拿它做的事上。

Step 1:把六个轴抄下来,每条转成一个问题

论文那套框架说白了就是六个问句,拿你手上的 agent 挨个回答。我不照抄学术措辞,给能直接用的版本:

  • 架构模式:这玩意儿是单体,还是多个角色协作?
  • 安全态势:权限是放开的,还是最小化的?
  • 工具集成模型:它靠什么接外部能力——MCP 一大堆,还是内置几个固定工具?
  • 执行范式:它是按部就班跑完,还是跑一步看一步不停调整?
  • 自主性与人类控制:全程没你的事,还是每个关键动作都得你点头?
  • 部署拓扑:它活在本地,还是常驻云端?

六个答案填完,你手里就是一份能拿去跟别人讨论的 agent 档案。别管术语看着吓人,你就回答我的问题,答案是什么就写什么。

验证这一步成了的标准:你能不看论文,把这六个问题口述给你团队里任何一个人,他能听懂。

Step 2:拿你的 agent 逐轴填表,顺便填一份样例让你对着抄格式

这一步是把模板落到你自己的东西上。我拿 OpenClaw 填了一份样例:

agent: OpenClaw
架构: 主代理+插件扩展
安全: 分层,权限粒度中等偏细
工具:  MCP 接外部工具
执行: 任务队列顺序执行
自主性: 默认人类审批,部分子任务可被委托
部署: 本地优先

插播一句:如果你填到一半发现只能填上“部署”和“工具”两格就卡住了,别慌,这很正常。论文作者拿八个主流平台实测的时候,也没法一眼填全所有轴——配置、文档、权限模型得各看一遍。你卡住的那一格,恰恰是接下来最该去搞清楚的。

我填到安全那一格犹豫了一下。平时用着没觉得有什么,照着框架一框,它的安全态势确实就是个“中等偏细”,离企业级差着好几档。填表这个动作本身就会逼你面对平时忽略的事。

Step 3:对着填完的档案,看那个空白

论文真正值钱的是最后几页分析——八个平台分类完摆在一起,浮现出来的东西比单个平台有意思得多。里面有个最扎眼的发现:

在你所能想到的主流配置下,没有发现任何一个系统同时具备本地优先部署 + 企业级安全。

这不是巧合。工具们卷能力、卷自主性,卷了这么久,恰恰在最不该被忽视的轴——安全——跟“本地部署”这个需求之间,留了一个没人填的坑。

你手里的 agent 不管填出来是什么位置,只要落在“本地优先”这一格,你面前就摊着一个明确的对手盘:安全态势不够企业级。往这个方向做,不是做增量,是做填空。论文里还有一套跨平台模式的分析,值得单独聊,这篇就不展开了,以后单开一篇。

收尾

到这里,六轴填完,那个空白你也看见了。跑起来了吗,照这个自查:

  • 六个轴的答案都填完了,没有空着的格
  • 你能指出它最大的偏科方向,并且说出偏科的代价是什么
  • 你知道它落在“安全-部署”象限的哪个位置,离那个空白还有多远

都打勾了,这篇就算交付。接下来你可以挑一根轴往下深挖——比如试着把安全态势从“中等偏细”往“最小权限+逐项审批”那边挪一挪;或者顺手给团队里别的工具也填一份,对比着看谁能先碰到那块空白。

更多「Agent」的实战

评论

还没有评论,写下第一条讨论。