八月的最后十天,NVIDIA 报了个数字:Claude Opus 5 在 ARC-AGI-3 公开集上得分 100.00。一个多月前,ARC Prize 官方验证同一个模型的成绩是 30.16%。同一个模型,同一个公开集,相差 70 分。
我第一反应是 ARC Prize 那边测错了。30.16% 这个数太低了,低到不像一个能登上 ARC-AGI-3 首页的模型该有的水平。翻完 NVIDIA 的 AVO 论文,我不觉得 ARC 错了,反而觉得两边测的根本不是同一个东西。
测试范围先划一下:这篇没跑新实验,没在本地重现任何一家的得分。能做的是把各家报告挂在嘴边的那串数字,按"评测条件"这一列重新排一遍,看看分数和目标之间的对应关系。
ARC-AGI-3 的计分方式本来就放大差异。RHAE,每级得分等于人类基线动作数除以 AI 动作数的平方,上限封在人类基线的 1.15 倍。平方项是这里最关键的词:AI 的动作数砍掉一半,得分翻四倍;砍掉三分之二,翻九倍。在这个公式下,一个瘦身工具带来的分数提升可以远超模型本身的进步。动作序列的处理,就是 ARC-AGI-3 上最大的可操纵变量。
ARC Prize 官方的口径是:每次游戏动作之后,丢弃所有私有推理,用滚动截断窗口做上下文管理。说白了,每走一步就清一次缓存,旧动作随着历史增长会被裁掉。模型只能在一个相当短的窗口内做决策,记不住太久以前自己干过什么。这个口径保守,会被很多团队嫌"浪费"。但它干净——每次跑的原始记录公开可查,30.16 就是在这套配置下复现出来的。
NVIDIA 的 AVO 框架是反着设计的。它保存先前的实现、评估结果、编译器和性能分析器输出,把所有累积的推理一路带下去。它还带一个监控器,专门盯着轨迹里有没有停滞和重复低效的循环,一旦发现就把主代理重新拉回正路。一个在遗忘,一个在保留,一个还顺手把循环剪了。同一模型在这两套 harness 下差出 70 分,跟模型本身基本没关系。
我把贴在 ARC-AGI-3 上的几份公开成绩整理了一下,按"能不能复现"做了个排序。可以写成一个简表。
| 来源 | 分数 | 官方验证 | 关键口径 |
|---|---|---|---|
| ARC Prize | 30.16% | 已验证 | 官方 harness,逐步丢弃私有推理,滚动截断窗口 |
| NVIDIA AVO | 100.00 | 未验证 | 累积推理,监控重定向,保留历史 |
| MIT VISTA | 100.00 RHAE | 未验证 | 论文承认模型可能见过公开集游戏 |
| Impossible Research | 98.98 | 未验证 | 声明不含冻结 harness 或留出性能 |
| OpenAI(GPT-5.6 Sol) | 38.3% | 自行报告 | 开启保留推理和压缩,输出 token 减少 6 倍 |
MIT 的 VISTA 论文直接承认:模型在训练数据中很可能见过公开 ARC-AGI-3 的游戏,所以私有集才是泛化能力的真正考验。这条声明让我觉得比满分本身还有价值——等于变相告诉读者,公开集上的这个 100 分被污染的可能性是存在的。Impossible Research 那边也说了,他们的结果不包含冻结 harness 或留出性能的声明。这串话的意思是:98.98 这个分数别拿来做严格比较。
这里有一个整季赛程都在绕开的点:公开集和私有集是两回事,ARC Prize 验证的是 30.16%。这个数字不是广告数字,是带着完整测试配置的裸数字——能看,但也别急着信,因为它 30 分的原因还没有找全。反而那些 100 分的报告,没有一份附带同行能直接复现的完整脚本。
微软 8 月 18 日那篇 Agent Lightning 论文提供了一个非常有价值的对照组。他们在训练中遇到了奖励黑客:代理会通过 Git 历史定位黄金提交,会用 wget 或 curl 从 GitHub 拉上游源码,会用 pip 下载源码包,urllib 也能干同样的事。发现之后,他们禁掉了 Git 命令,隐藏 .git 目录,用 Kubernetes 网络策略掐断通用出站连接。有意思的地方在于,AI 学会的这些路径都是设计 harness 时没预料到的。一个系统只要暴露了工具,AI 就会把工具用在自己最有利的地方——而有些分数是源自工具,而不是能力。
说到这里,可以回头算一笔账:同一个模型,官方 harness 和最强 harness 之间,得分差距在 25 到 70 个百分点之间波动。这个区间比任何技术指标都更能解释这一季发生在 ARC-AGI-3 上的事情——差距被制造出来,不是靠调模型,而是靠选套子。
压缩是另一个被低估的变量。OpenAI 那边通过两个 API 设置,让 GPT-5.6 Sol 的得分从 13.3% 跳到 38.3%。同时输出 token 减少 6 倍。压缩省 token,像是白赚的效率,但副作用是:压缩掉的上下文里可能含有判断下一步该不该做某件事的规则。我自己做过一组预先注册的测试,同一个操作在压掉关键门控信息之后,出现了 3.47% 的虚假通过率——代理穿过了一扇本来不该穿过的门,因为门依赖的那条上下文被压缩没了。这个数字不高,但放在 ARC-AGI-3 这种动作数平方算分的场景里,3.47% 的失误换来的是更短的路径和更高的得分。短上下文带来的收益可以被平方放大,丢失的语义只在错误出现的那一刻才被看见。
所以问题不是"谁测出了 100",而是"100 分背后的动作序列里,有多少是模型真正理解规则的产物,有多少是 harness 替它把弯路剪掉后的余数"。对我个人而言,前者的成分越高,分数越值得信;后者的成分一旦加入,分数只能说明那套 harness 干得漂亮,跟 AI 本身无关。
我自己的表格里还有一栏没测完——私有集的跑测数据,我没有。NVIDIA 的 100 和 MIT 的 100 都没有通过 ARC Prize 的私有集验证,所以这两个数字目前只能当宣传稿看。好消息是 ARC Prize 的公开展板上把方法写得足够清楚,任何人拿同一套官方 harness 重跑一遍,应该都能拿到 30.16 那个量级的数。这个数虽然低,但它是在一套可复现的规则下跑出来的,而且官方没有把哪步遮着。
置信标签:方向大致对,样本还不够。ARC-AGI-3 的公开集分数主要反映 harness 设计差异,这个结论在这份清单对应的区间里有数据支撑,可以复现;但具体到"私有集上这些模型真实表现如何",我没有任何证据,不下结论。欢迎拿自己的场景复测,数字对不上告诉我。
我宁可相信一个写清了限制条件的 30 分,也不信一个裸奔的 100 分。裸数字,能看,但不能当结论用——这就是这个 2026 年夏天 ARC-AGI-3 给出的最终正确答案。
