跳到主要内容

昨晚刷到一个诚实到扎眼的项目:9% 通过率,但它说的是真话

小周
小周

· 阅读约 5 分钟

昨晚照旧刷 dev.to,刷到一篇标题特别实诚的文章,作者说他跑了一百五十多个仓库里的 agent,总通过率 9%。原话大概是"这数字让我重新想了一下评估到底该怎么做"。顺着链接摸过去,就是 deghosal-2026/agent-eval-forge,一个给真实 agent 跑回归和对抗性评估的工具,pip 一条命令就能装。但这期我想聊的其实不是它有多好用,而是它用 9% 这个数字拆穿了一件事——评估工具这行的水,比你想的深得多。

先说它是干嘛的。一句话定调:一个给真实 agent 跑回归和对抗性评估的工具。它定义了一整套关键用户旅程,拆成场景包引擎、运行器、评分层、回归引擎、对抗性生成器五块。看得出来是个正经工程,不是周末冲出来的玩具。

但它最打动我的,是那个适配器合同。它给五种不同接口的 agent 各写了适配器,合同上规定得很死:agent 只能收到受限调用——场景输入、允许工具、禁止工具、预算——预期答案和评分阈值它永远看不到。就这一条,作者脑子里那根"评估者的嘴不能漏风"的弦,比大多数糊个脚本上去比输出的项目紧多了。

但真正让我坐直了看的,是那个现场测试报告。作者从一百五十多个仓库里筛出十九个能跑的 agent,其中十一个 LangGraph、八个 PydanticAI。注意他说的大量仓库被淘汰的理由:框架过重、需要数据库基础设施、缺少清晰入口点、没有 API 密钥。这句话我看了两遍。划重点——"需要数据库"和"没有密钥"才是真实世界里 agent 仓库的常态,而不是那些炫酷的 demo 视频里演示的完美启动画面。他把十九个按星数分成三组,在本地和云上两层跑了九十五个场景,总通过率 9%。

九十五个场景里通过九个。这个数字我盯了半分钟。让一个东西跑起来,比让一个东西输出正确答案,难了不止一个量级。

作者自己的解读是,9% 主要衡量的是"适配器真实性"而不是 agent 质量,空白完成属于兼容性失败而非质量失败。我完全同意。你去看他挂出来的问题:有 agent 在导入时往 /root 写东西,有 agent 在模块作用域里硬编码了模型实例,还有三个 agent 因为一个 C 扩展的 ABI 对不上被隔离。这些都不是"模型不够聪明"的问题,是"别人的代码跑起来"这个最原始的问题。

这让我想起自己折腾开源项目时那些深夜——老实说,9% 这个数字一点都不让我意外。它只是把一个大家心里都有数、但没人愿意公开承认的事,摊开在阳光下。

最让我意外的是另一个发现:gpt-4o 和 gpt-4o-mini 两个云层跑出来的结果完全一样——都是九十五个过九,贵出几倍的模型一个额外问题都没发现。这个数据点值得那些觉得"换更聪明的模型就全解决了"的人冷静一下。瓶颈根本不在模型智商,在接口接得真不真。

但 9% 也有特别提气的一面:有个叫 lg-mcp-agents 的 LangGraph 多 agent 仓库,在适配之后两个云层都跑出 5/5 通过。这说明了什么?说明只要 agent 结构干净、入口清晰、依赖声明完整,它就能在严苛的评估里活下来。不能打?先看看是不是自己代码没收拾利索。

这项目最戳我的,是坦诚。作者在后记里承认,现场测试层是后期临时加的,原计划根本没有——因为最初以为单元测试加模拟就够用了,结果被真实 agent 的行为暴打了一顿。他总结说:单元和模拟覆盖是必要但不充分的,评估工具必须从设计之初就规划真实 agent 现场层。这话我信,因为他说这话时手上有百余个仓库的一手数据。

另一个值得记住的点,是它的评分设计:安全高于正确性、正确性高于效率。安全失败直接让 run 失败,正确性回归默认只警告,效率回归只是参考。我不去评这个排序对错,但顺序本身就把作者的立场说得很白:独立开源构建者第一,小团队第二,平台团队第三。最小有意义的成功,是你合并前能拦住一个回归。这个目标够克制。它没有试图把评估做成一个跑分擂台,这在一个"我什么都能测"的年代里,已经算得上审美了。

摸完一圈我反而有点明白它为什么选在 dev.to 首发而不是去冲 trending——它还没准备好。v0.1.0 已经能导入、配置、调用、评分真实的第三方 agent,但作者自己都没敢说它可以大规模排名。它还缺很多东西:没有"什么时候能正式集成大规模名册"的时间表,PydanticAI 包装器里有几个返回空白完成的 bug 还没定位,SWE-bench 和 WebArena 连接器虽然验证过但没默认跑。整体就是一个正在长牙齿的版本,咬得动人,但齿缝还有点漏风。

适合谁用?如果你手头在维护真实 agent 仓库,想看看它换个环境还能不能站起来,这个工具能帮你在合并前发现一堆"我居然在导入时往根目录写文件"的荒唐事——这些事情,只有让它真的跑一遍你才信。不适合谁?想拿它当跑分工具给一堆 agent 排名的,现在太早了,作者自己都没敢下这个结论。

我的建议是:挂个 star,放一阵,等它把文档补上,等适配器生态再肥一点,然后拿自己的 agent 进去遛一圈——但我先跟你说好,9% 那关,多少有点考验心理素质。至于工具本身能不能打,我还是那句老话,你自己上手跑一次最准。

候选池里还有个同类项目,方向不一样,那个主打轻量场景。等它再长一阵子,下次一起讲。这期的账先记到这儿,溜了。