上礼拜 arXiv 挂了个新 benchmark,SRE-Bench,8 月 11 号的,做逆向工程方向的 agentic 安全评测。我一般对「新 benchmark」三个字免疫——这行每年长出来的 benchmark 比生产事故还多,多数是灌水。这个我认真看完了。
原因不复杂:真专家拿五千多个小时堆的,19 个私有真程序,平均一个 1.69 万行代码。
私有。这两个字在 2026 年比什么都金贵。网上扒来的二进制做评测,模型早把答案背进 context window 里了,测出来 90 分,你都不知道是在测模型还是在测背书。这 benchmark 还配了 44 个反分析原语防混淆,消融实验也验证了防污染和真实规模缺一不可——不是那种跑个脚本爬点数据就敢叫 Bench 的活儿。
然后是卷子。五个前沿模型上桌:GPT-5.6-sol、Claude-Opus-5、GPT-5.5、Grok-4.5、GLM-5.2。
最强的 GPT-5.6-sol,按实例算 61.4%。整个 benchmark 完全解掉的,31.5%。
三分之一。这是 2026 年最强的模型,在没有污染、真刀真枪的二进制面前交的卷子。
我为什么在意这个数——过去两年,「AI 安全研究员要取代人了」这套话术我听得耳朵起茧。逻辑永远是:你看模型写代码多强,CTF 都打通了,二进制分析还不是顺手的事?安全团队砍一半,留个 agent 盯着。
现在有人真开了个不容作弊的考场。卷子发下来,最强的考生三道题解不出两道。
更扎的是论文里那条观察:agent 和人类工程师的行为模式完全不是一回事。人对编译器优化、静态链接这些干扰极其敏感——加一层优化,人类逆向的工时就往上翻。agent 不怎么敏感。
听着像优点?换个角度想。这恰恰说明它不是「像人一样在分析」,是在用另一套我们说不清的东西蒙。蒙对了是 61.4%,那蒙错的 38.6%……你敢让它碰生产环境里的恶意样本吗?
补一刀:源码层面的安全能力根本迁移不到二进制上。这是论文自己点的结论,也是我最想抄给拍脑袋砍安全预算的人看的一句。写代码强不等于逆向强,就像会写文章不等于会验尸——尸体不会告诉你它想干什么。
扯远了,说回我自己。这事儿我一开始的判断就错了:以为是「又一个刷榜的」,看完改了主意。不是因为它写得多好,是因为它测的东西太少了。整个行业在 source code 上卷出天际,评测一个接一个,真到二进制、到没人给你源码、到对面就是不想让你看懂的那个世界里,正经的尺子一只手数得过来。这不是模型的问题,是行业的注意力分配有病——光的地方越来越亮,暗的地方越来越没人看。
而暗的地方才是事故住的地方。
我接过的那些半夜电话,真没几个是 README 写清楚了的系统挂了。挂的永远是那个没人敢动的屎山,没文档、没源码、只剩一个五年前编译出来的二进制的祖传组件。那种时刻你需要的恰恰是逆向能力——恰恰是现在所有模型最弱的那一环。
所以别急着信「安全也要被 AI 颠覆了」。模型解一个真实规模的二进制只能解三分之一,线上的屎山比考题还难——考题至少是专家出好、确定性打分的,屎山连题目是什么都要你自己猜。
指望 agent 自动 remediate 的那位,这个数给你提个醒:61.4% 放到生产环境,翻译过来就是每三次操作翻车一次多。你敢让值长有这个成功率吗?我不敢。
本期教训:看一个 AI 能力的宣传,先问一句——在不容作弊的考场上,它几分。这把尺子 SRE-Bench 给你造好了,用不用随你。
反正模型不接半夜的电话。这个剧本我看过太多遍了,主演换成了 agent 而已。