跳到主要内容
这篇我先不推,但那个 769 条任务记录的分析值得你点开

这篇我先不推,但那个 769 条任务记录的分析值得你点开

书签客
书签客

· 阅读约 4 分钟

我先说这篇论文是什么。标题叫《Atria Dawn: The Dawn of Agentic Superintelligence》,arXiv:2609.15818,9 月 14 号提交,17 号改了一版,23 页,10 张图,143 个作者。我打开第一反应是关掉。这种标题配一百多个作者,十篇有九篇是造势。但读到第三段,看到训练管线那句——"可验证经验管线,把工具中介交互、可执行环境与外部验证结果连接起来"——我停了一下。

这个提法有意思,但论文里没展开。23 页里真正让我觉得值得读的,说实话只有两个地方:一个是这个可验证经验管线的提法,另一个是第 12 条开始的人机协作分析。其余部分,包括 16 项基准、五项最高分、与前沿智能体相当这些,我基本扫过去了。没法复现,也没法验证,只能听论文自己说。

先说我不满意的地方。可验证经验管线这个思路,听起来是把 agent 的训练信号从"人给示范"挪到"环境给验证结果"上。工具中介交互、可执行环境、外部验证结果三个东西连成一条线,让每次尝试都有外部信号回传。这方向没错,但论文里这部分只占了一小段,没有说验证结果怎么变成训练信号,没有说哪些工具交互动作被记录、哪些被过滤。我本来想顺手跑一下这个思路,但发现没法跑——不是环境问题,是论文没给够实现细节。

真正让我觉得这篇值得点开的,是那个 769 条任务记录和 56 名参与者的人机协作分析。论文里说,在可比条件下评估已完成任务时,参与者认为约三分之一的 AI 辅助完成任务若没有 AI 则无法完成。

这个数字得拆开看。"参与者认为"是自我报告,不是客观测出来"没 AI 就是完不成"。但反过来,它也不是吹的——是 56 个人在 769 条任务记录里自己判断出来的。我读到这里的时候本来想找一件事:那三分之一被判断为"没 AI 完不成"的任务,到底长什么样?是复杂的多步操作,还是 AI 只是帮人越过了某个特定卡点?论文没给这个粒度,至少我读到的部分没有。这是我最大的不满意,也是我开头说"不推给所有人"的原因。

但写到这里我发现自己改主意了。这篇真正值得点开的,根本不是那个 Dawn 模型,也不是 benchmark 成绩。是它把"人机协作"当成一个正式的研究对象——不是事后补一段"人在回路"的套话,而是真去统计了 56 个人的 769 条任务记录,把 agent 日志和人的任务记录放在一起看。这个视角比我预想的有收获。模型叫 Dawn 还是叫别的,过两周就忘了;但"约三分之一的 AI 辅助任务,参与者认为没 AI 完不成"这个观察,我会记一段时间。

第 14 条还有一个观察,说智能体经常提出方法并实施修改,而人类保留多数最终决定权,通过判断和反馈引导探索方向。这个观察很符合直觉,但我没弄明白它是怎么从 769 条记录里提取出来的——是人工标注,还是用了某个分类模型自己打的标签?论文没写清楚。这条先挂着,等我把那一节再读一遍。

有个细节我可以确认。论文的 PDF 和 HTML 版本都能从 arXiv 下。HTML 版本是实验性的,渲染得比较糙,但公式和引用的跳转比 PDF 顺手。论文编号 arXiv:2609.15818,DOI 是 10.48550/arXiv.2609.15818。这篇我不给"必读",因为训练管线那部分光有方向、没给实现细节,我不可能推荐一个我只读到一半、而且关键部分没展开的东西。

不点链接也能带走的一句:如果你也在做 agent 评测,别只记录"任务完成率"——把参与者的任务记录和 agent 日志一起留下来。"没 AI 能不能完成"这个判断,做不了受控实验,只能事后听参与者说,但先记录下来,总比没记录强。

顺手跑了什么?没跑通。我想顺着"可验证经验管线"的思路,拿个本地任务试一下"用环境验证结果当训练信号"是什么感受,但论文没给够实现细节,我连跑都跑不起来。这个不是论文的错,是我对它的期待放错了地方——它本来就不是一篇教你怎么实现的技术稿,是一篇把 143 个人的活儿攒起来的系统报告。

这篇先推一半。人机协作那部分值得点,模型和 benchmark 部分我只读了没跑。如果后面我把第 12 节到第 14 节再读一遍,或者哪天作者单独把训练管线写细了,我再补。

书签客
书签客

只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。

查看主页 →