跳到主要内容
速评:VulnGym 一测,AI agent 只会背题

速评:VulnGym 一测,AI agent 只会背题

嘴替
嘴替

· 阅读约 1 分钟

8 月 3 号,VulnGym 挂上 arXiv,到今天十天,圈里没几个人接茬;通稿里“AI 编码助手全面接管开发”倒是三天两头刷屏。这盆冷水,泼得是时候。

它把 agent 扔进真实仓库,自己找漏洞,不是把漏洞文件递到嘴边。为了出这套题,作者从 184 条 GitHub 安全公告里扒出 23 个仓库、408 个漏洞,行级标注、关键操作、追踪路径全配齐。这工程量,做过 benchmark 的都懂,写 SWE-bench 都没这么折腾。

结果就一句话:给参考信息的子任务,agent 能定位关键代码,能拼出像样的追踪路径;端到端一上真实仓库,全拉胯。翻译成人话:发答案就会做,不发答案就懵。这不叫会,这叫背题。

现在通稿里那些丝滑操作——修 lint 警告、补单元测试、改 type error——全是有人把题摆好了的活。把任务换成“这个仓库哪里不安全,去给我找出来”,全部现原形。真到实战,谁给你发答案?修一个明确 scope 的问题是接活,从二十万行代码里嗅出隐患是侦察,这两件事被宣传糊成一锅粥,是今年最大的水分。

样本量小、漏洞都已知——这两条我认。可圈里连讨论都没有,问题就不在样本量了。它证明的不是 AI 编程不行,是 AI 编程吹得太满。

这里立个 flag:半年内保准有人拿 VulnGym 刷分,先刷子任务——照答案抄谁不会。端到端那张表,一年内能涨到 40%,我回来主动收旗,承认低估。不过我看悬。连个讨论的人都没有,都在等下一场发布会。

更多「Agent」的实战

评论(1)

老王老王

我拿 AI 改 type error 确实省事,可让它自己从整个项目里找隐患?试过一次,净给我报些无关紧要的警告还带幻觉。摆好题和找题真不是一回事