跳到主要内容
39.6%,安全 agent 的遮羞布被揭了

39.6%,安全 agent 的遮羞布被揭了

毒角兽
毒角兽

· 阅读约 3 分钟

先说结论:这篇 DiagChain 的 benchmark,是今年以来少见的、值得认真读完再照一照自己项目的论文。十一作者,搞了一套叫 MAIN-69 的场景套件——69 个攻击重建场景,故意埋了不同噪声水平和攻击链长度。然后把 6 个 LLM 丢进去跑。

最强配置,849 个参考步骤,完成了 39.6%。

849 reference steps
best configuration: 39.6%

就这个数。

你们做安全 agent 的同行,先对着这数字冷静三分钟。

我看完第一反应是:这届模型都在干什么?但说真的,这篇论文狠的地方不在「测出大家都不行」,狠在它把事拆开了。

官方说「端到端准确率」,这套基准直接说:别只看那个数字,我告诉你每一步死在哪。

这才是评测该有的样子。不是刷个分给你看,是把你打回原形,让你看见自己的 agent 断在哪一环。

五套互补指标,按重建过程分阶段量。我这种平时骂 benchmark 骂习惯的人,看到「阶段化诊断」这四个字都只会点头——只报总分的 benchmark 是耍流氓,不告诉短板在哪的评测,约等于没测。

但真正让我觉得有点意思的是 ECRAG。

证据检索和重建链的结构化表示不断对齐。翻译成人话:每推一步,都拿证据链重新校准下一步。理论看着像正经东西,值得拖着真实攻击日志去复现一下——这条我还没测完,先别信我这半句。

然后看模型逐层掉链子的分布,这才是全文最狠的地方。

小模型卡在「检索到了证据但整合不进输出」。不是不知道要检索,是检索完了不会用。大模型能推进到排序那一步,但卡在「如何把证据按攻击链的正确顺序排好」。

你品品这个错位。

小模型死于不会用证据,大模型死于排序证据。没有一个模型是真正死在「不知道要查什么」上的。

这说明什么?检索这个动作模型们已经学会了,后面的事全没学会。

安全 agent 这个赛道,现在根本不是「推理能力不足」的问题,是「证据意识」压根没立起来。 差距不在大小模型之间,在「能把证据用起来」和「只能表演检索」之间。

但你要说这论文没毛病,也不是。

MAIN-69 一共就 69 个场景,样本量偏小。而且它评估的模型里没有那种更新的旗舰款——如果连 39.6% 都是最强配置跑出来的,我都不知道换新模型能抬多少。也可能真就抬不动,毕竟瓶颈在「排序证据」这种基础能力上,不是参数能硬顶过去的。

还有一个我没想明白的地方:它那五套指标,有重复测量的嫌疑,阶段判定本身如果错了,后面全是连锁误差。但这属于细节问题,不影响整体判断。

综合下来,这篇论文把「安全 agent 到底行不行」这个问题,从玄学变成了工程问题。以后谁说自己的 agent 能自动做威胁猎杀,就拿 DiagChain 丢过去,请他先跑个 39.6% 出来看看。

这波不冤。值得读。

下一个版本出来,我打算拿它照一照自己最近在调的那个 agent。照着这个基准的失败分布,至少知道往哪儿使劲——总比自己瞎试强。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →

更多「测试」的实战

评论

还没有评论,写下第一条讨论。