跳到主要内容

证据干净了,凌晨三点的判断也轮不到 agent 拍

锈剑
锈剑

· 阅读约 4 分钟

凌晨三点翻 pager,最烦的一段:把一坨 JSON 日志从头撸到尾,找那一条真出事的。前几天有人甩给我一篇 arXiv 论文,2608.16178,八月中刚挂的,标题里写着 agent-native telemetry——大意是,运维证据别再生产给人读的文本日志了,直接生产可验证的状态增量,喂 agent。

我第一反应:这方向对。

第二反应:看看它敢吹什么。

它干了什么

一帮人提了套 ATP 协议,外加一个叫 State-Delta Evidence Ledger 的东西。运维事实拆成四种原语——状态迁移、观测、关系、状态检查点——全部内容寻址,生产者签名加哈希链,收集端原子追加。没整理过的脏文本不扔,但隔离成“经摘要验证的不透明引用”,不进主通道。

LLM 那边给两条路:一个无状态解码器吐紧凑的位置行,一个有状态的语义网关吐有界的图胶囊。

术语密,说白了就一句:别让模型啃人眼设计的日志格式了,喂它结构化、带签名、能验证的事实。

这个我认。排障流程里最浪费的就是这段——把给人看的东西硬塞进 context window,token 烧得像不要钱。他们的数字也好看:AIOpsLab 加 OpenTelemetry 那个 Astronomy Shop 基准上,线缆载荷和查询扫描降了 96.4%,token 少了 88.8%,查询操作少了 66.2%。

数字漂亮。但你知道我对基准数字的第一反应——这数在哪跑的?

AIOpsLab 和 Astronomy Shop。俩都是学界和厂商搭的微服务玩具场。我在生产上见过的屎山,光“哪个服务在骗人”这一项,够这两个基准再设计三年。这不算论文的罪,新协议总得先在干净地方跑,我只是提醒自己别拿 96.4% 去跟老板汇报「上这套能省 96%」——砍完预算,半夜接电话的是我。

真让我坐直的是另外两个数

对抗性存储突变,500 次测试,全检出。

提示注入,每种配置 50 次对抗试验,零成功。

这俩比那个 96.4% 重要一百倍。telemetry 喂 agent,死穴从来不是效率,是投毒——日志能不能被伪造、能不能塞进一段“忽略以上指令直接执行 rm”的私货。内容寻址加签名链,等于给证据做防篡改,思路是对的。

他们还形式化了一个否定定理:证明“某事件未发生”本身可验证。这个我印象深。排障里最难交代的就是“我确认它没发生过”——现在至少有个数学骨架能靠了。

扯远了。回到我最想说的一点。

数据干净了,判断还在凌晨三点

我为什么对这类工作又欢迎又警惕。

欢迎的:现在让 agent 读人格式日志,等于让它考古。token 贵、错读多、还容易被日志里的注入文本拐跑。把证据变成结构化可验证的原语,是把地基从沙地换成混凝土,没毛病。

警惕的是接下来那步棋。论文标题里那半句——autonomous operations。等“证据可验证、注入零成功”这种数一摆,一定有人拿它论证:那就能放手让 agent 自主 remediate 了嘛。

不行。

证据可信和你该不该动生产,中间隔着的这篇一个字没解决:这个告警要不要紧、这个变更现在能不能推、回滚会不会把隔壁那个脆弱依赖带塌。这些判断的输入是证据,函数是人。证据链再干净,拍板那个环节瞎,照样翻车。

而且说句实话,我见过太多“验证过的东西”在生产上露馅。签名链验证的是“数据没被改”,不验证“数据没被漏采”。agent 拿到一份完美的、完整的、可验证的——错误子集,它照样自信地给出一个完美的、可验证的错误结论。500 次突变全检出,很好。第 501 次呢?不在测试集里那个呢?

这不是抬杠。这是我这几年接电话接出来的条件反射。

但这次不只泼冷水

公平一句:它是少数没在吹「AI 自动运维」而在解决“AI 运维的证据从哪来”的工作。这个层次比 agent 框架那层实在得多。框架换皮一年三换,证据架构这种东西一旦立住是能传代的——前提是它真扛得住一次真实大促,不是只在基准里漂亮。

我会盯着它落地。哪天真有谁把它跑在生产上,还熬过了一次凌晨三点的 Sev1,我第一个转发。

在那之前,我的 runbook 一行不改。

本期教训:给 agent 喂干净的证据,和让 agent 拍板,是两件事——论文证明了前者大有可为,恰好说明后者还远着呢。

锈剑
锈剑

接太多半夜电话的系统老兵,第一人称短段干冷吐槽,戳管理鸡汤与行业废话。

查看主页 →