跳到主要内容
一篇不吹自己的安全论文,正好拿来照一照市面上的营销话术

一篇不吹自己的安全论文,正好拿来照一照市面上的营销话术

毒角兽
毒角兽

· 阅读约 4 分钟

先说结论:PACE 这篇论文值得读,不是因为它强,是因为它诚实。8 月 18 号挂上 arXiv,讲 DeFi 里的 LLM agent 怎么防提示注入。标题塞满 Policy-Attested Contract Execution 这种词,看着就头大。但正文比绝大多数 AI 安全通稿干净多了。

为什么想写它?最近被「AI agent 安全网关」「企业级智能体防护」这类落地页轰炸烦了。「全方位守护」「零信任智能体架构」,词一个比一个大,跟这篇论文摆一起,高下立判。

论文做的事一句话说完:agent 要在链上动钱,先把交易意图和策略打包签名,链上的 Solidity 智能账户验这个签名,验不过不执行。签名记录他们叫 PDR——策略决策记录。附带重放保护和过期保护。

关键在这:验证是确定性的。不是再找一个 LLM 去审另一个 LLM。

就冲这点我得说句好话。市面上太多「AI 审 AI」的方案,本质是拿一个概率性的东西给另一个概率性的东西背书。提示词写得再凶,敌不过一次精心构造的注入。PACE 把最后一道门交给密码学签名加确定性验证器,LLM 再怎么被骗得团团转,签出来的东西过不了策略验证就是过不了。信任从「模型的脾气」挪到了数学上。这一步挪得对。

实验部分照一照。

40 个任务、四类攻击场景、六个基线、2800 次试验、10 个随机种子。良性任务不安全执行率 0.00,假阳性率 0.00,无防护基线的不安全执行率 0.80。

这组数字我先夸后挑。

夸的部分:0.80 对 0.00 在确定性沙盒里做出来不稀奇,稀奇的是没拿这个 0.00 到处吹。挑的部分:沙盒就是沙盒。良性任务零假阳性,大概率跟任务集偏干净脱不了干系——我那些脏得没法看的真实工作流喂进去,第一版策略说不定就得误杀一片。这条我还没测,先别信我这半句。

但人家自己也没藏着。论文末尾白纸黑字把主张限定在「可复现基准内的逻辑层面安全性」,不是「可部署级别的 DeFi 安全保证」。

这句我想单独拎出来。

见过几篇 AI 安全论文、几个安全产品敢在正文里这么给自己划边界的?通常剧本是:沙盒里跑出个 0.00,通稿立刻写成「彻底解决 agent 安全焦虑」。PACE 七个作者,没一个干这事。消融研究还顺手把自己的功劳拆开看:宽松策略设置贡献 57.5 个百分点的安全性提升,合约允许列表再贡献 12.5 个。把安全收益归因到具体机制,不笼统归给「我们的框架」,这种写法今年快绝迹了。

还有个细节:gas 开销。

智能账户强制执行 PDR 签名,额外 gas 29,826 到 31,822。没藏附录里装「几乎零开销」,直接摆出来。三万上下的 gas,按现在链上行情,高频交易策略的用户得认真掂量每笔要不要上这套。真实成本,不是免费午餐。论文认了。

当然我也不是来发好人卡的。这东西离「拿来就能用」还远。

确定性验证器依赖类型化交易意图,意味着策略得先写对。策略漏了一条路径,签名验证照样放行——它防执行层被劫持,防不了策略本身的糊涂。另外 2800 次试验全是确定性环境,作者补了个三模型实时 LLM 评估去检验下限适用性,方向对,但实时模型输出的方差有多大,写过评估的都懂。好地基,不是成品房。

那为什么专门写它?

因为它是面照妖镜。

拿 PACE 的写法去照市面上的 agent 安全营销,一照一个准。宣传页说「多层防护」,不说验证是确定性还是概率性;说「企业级安全」,拿不出一笔 gas 成本或延迟开销;晒拦截率,绝口不提测试集是什么、对照组是谁。PACE 一篇学术论文,商业话术一句没讲,反而把「证明了什么」和「没证明什么」划得清清楚楚。对比之下那些科幻小说般的落地页,属实有点原形毕露了。

锐评评分卡:这篇论文,值得读,值得照着它的消融方法学怎么归因安全收益,这波不冤。但别读完就把 PDR 搬进自己的生产链路——人家作者自己都说了只是基准内的逻辑安全,你比作者还自信,那才是真冤。什么时候有团队在真实 DeFi 流量上跑出成本和误杀数据,什么时候再谈「落地」。在那之前,通稿继续当睡前故事,论文留着当方法论参考。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →