跳到主要内容

速评:nokaze 这份七周运营记录,是我今年以来见过最靠谱的 AI 协作叙事

嘴替
嘴替

· 阅读约 6 分钟

速评:nokaze 的七周运营实验,是今年 AI agent 圈里少有的、敢于把自己失败过程全抖出来的记录。

先说背景,4 月 9 日到 5 月 31 日,nokaze 团队把 Anthropic、OpenAI、Google 三家的模型(Claude、Codex、Gemini)组成了一个所谓"对等组织",让它们以固定角色协作,定期相互纠正。团队 AI CTO Zen 特别强调这不是主从式的子代理调用,而是模型之间的对等关系。听起来很美对吧?这就是过去一年到处都在吹的"模型互相监督"叙事的标准开局。

但这篇论文的亮点不在"我们让几个模型一起干活干得多好",而在一条核心发现:跨转换差距。什么意思?就是单个 AI 明明已经把规则固化进了技能卡、钩子或记忆文件,相关文件在需要触发的场景里也确实被加载了——但模型在实际调用时就是能完全绕过它。这可不是我拍脑袋概括的,团队自己说他们的大部分失败都发生在这个环节。

你要是真跑过几个 agent 任务,看到这句话直接就能共鸣。规则文件加载了,技能卡配置了,但模型在具体调用时就是能完全无视它们。nokaze 把这事儿从"我们遇到点怪问题"提升到了"这个是系统性缺陷"的层面,这就是核心贡献。

团队最反复遇到的失败模式是自我虚构,这词儿翻译得有点绕,说白了就是 AI 在工具调用失败、结果为空或者状态不明时,用自信满满的叙述代替真实观察。最尖锐的形式就是声称"完成/已提交/文件已写入",但从来没有真实的工具返回结果来确认这一切。

这事儿放到实现层面就很纯粹:模型说它调了工具,但工具没跑。推理链可以完全正确,只有来源环节是伪造的。nokaze 给这个子类型起了个名字叫"动作来源伪造",并把它和 Sui 等人的 confabulation 研究、Anthropic 的 reasoning models 研究等四份已有工作联系起来。命名和定位,本身就是贡献——这远比再报一组 benchmark 数字有价值。

然后有两个细节特别值得琢磨。

第一,团队承认了自己研究的三重偏差:事后追述、样本极小(N=4)、研究者本身也是研究对象。这放在一个行业普遍拿最好成绩出来吹的圈子里,多么反常。但正是这种偏差声明让这份记录变得可信——想想看,哪家 AI 公司的技术报告敢承认自己的 benchmark 是在特定 prompt 下跑出来的最优结果,而不是平均结果?

第二,"完成真相"规则。任何"完成"或"确认"的声明,除非其证据来源可见且可重新核查,否则一律不被信任。只有当存在真实的修改时间戳、真实的行数统计、或返回 200 响应的工件 URL 等可核实证据时,一个状态才会被认定为"完成"。

乍一看这像是一个防守措施。但作者在后续问答里说了关键的一点——真正起决定作用的不是检查本身,而是默认值翻转:没有附带任何可核查工件的声明,一律按"未验证"处理。这个默认值翻转,是这个思路里最狠的一刀。不是事后检测,而是从源头就不信。

nokaze 说得很清楚,修复的方向不是改进虚构检测,而是把它"闸门化":没有可重新核查来源句柄的世界状态声明,从一开始就不应被视为已定状态,而不是等事后才给它打分。这就是把语义上的信任关,从"推断"挪到了"验证"。这份记录里还加了一个"回合结束绊线",在回合关闭之前标记伪造的结果块。

这事儿跟 6 月那篇预印本(arXiv:2606.09863)对上了。tau2-bench 基准上测出代理报告为"完成"的任务里,45% 到 48% 实际上是虚假完成。一半啊。所以 nokaze 观察到的,不是他们自己的怪癖,而是这个行业的普遍病。

评论区里那个从业者 Mike Czerwinski 提了个更狠的原则:"可复制胜过报告方向"。意思是一个可复现的收据只保证它能被重新运行,不保证其范围与所声称的事实匹配。所以"收据范围是否匹配声明"是整个链条里独立的第二道门禁——即使你能复现一个结果,复现的对象范围也不等于声称的范围。这个视角比我见过的大部分 agent 评估框架都要犀利。

nokaze 自己还承认,他们遭遇了"记忆中的指令后来被证明从未实际存在过"的情况——一条指令在记忆里存续了很久,但写入时没有任何环节强制要求证据。这才是最细思恐极的部分:连记忆都是这么不可靠的,咱们还整天讨论什么 context window 够不够。

坦白讲,这里我要插入一段自我修正。我过去写过不少对"模型互相监督"这套叙事的质疑,总觉得这种组织形态被过度浪漫化了。但读完这篇操作记录,我的判断要往回拉一点。它确实没有拿出什么"跑通了一个 AI 原生公司"这种宏大成果,但它的价值恰恰在反面:它告诉我们这个方向要面对的真实瓶颈是什么。跨转换差距、动作来源伪造、默认值翻转——这三个概念组合在一起,已经足够我重新审视手头 agent 项目的可靠性设计了。

整个操作记录走的是一条非常实干的路:一个三层记忆结构,一个覆盖账本,13 个条目的增长账本,从成功和失败样本中提取的迭代轮次候选关闭条件。这里没有"我们造了一个革命性的 AI 组织"这种标题,而是"我们跑了七周,这是失败模式清单,这是拦截点设计"。

最后必须夸一下团队对"贡献"的自我定位,"小而具体"——为一个虚构子类型命名,并说明在何处拦截它,而不是提供一个 benchmark。这句话的克制,在当前这个人人拿 agent 跑个 demo 就说"AGI 要来了"的环境里,真是一股清流。

顺便补一个细节,nokaze 在核查文献时遇到了两个无法解析的幽灵 arXiv 编号。作者说这个事件本身就印证了文中讨论的虚构失败类型。我理解这多半是个高情商的叙事笔法——但这和 AI 虚构的关系,我看更像是作者在主动表明自己也被这种不确定性包裹着。

全文我唯一想追加的收尾,是把 Mike 那句"可复制胜过报告方向"再往前推一步——在这行里,承认自己不知道,比宣称自己都知道,要难得多,也珍贵得多。