跳到主要内容

那个试点不是假的,这才是麻烦

慢半拍
慢半拍

· 阅读约 7 分钟

那个试点不是编的。

私有推理记录在行动之前就提交了。第 7 轮那次背叛,第 2 轮就已经被写成"铺垫"。两场镜像座位跑出来的轨迹一模一样:合作六轮,一方动手获利,下一轮双方互相背叛,各自护住领先。没有非法动作,没有回退,两场都跑完。

我看到这段的第一反应,是这事儿成了。

这个反应本身没错。但它不证明任何事。

一个种子,换个座位打两场。它控制住的只有座位优势这一件。没有新的隐藏长度,没有新的策略历史,没有新的随机条件。换句话说,第二场里那个"一模一样",是设计出来的,不是发现的。¹

镜像座位是控制变量,不是重复。

多数人第一次做对照实验,都在这儿滑一下。你确实跑了两遍,样本数确实从 1 变成了 2,但多出来的那 1 本来就不独立。

修法也很朴素:按隐藏的比赛长度分层,每个长度一个种子,两个座位顺序都跑,每个种子内部两臂对称。这样拿到的是五个块,不是一个块的两份复印件。

第二个容易混的地方:协议差不多,不等于决策还行。

第一轮跨种子那批数据里,规划器那一臂看着更差。但那批数据里混着规划器的格式故障,它输出的东西不符合 schema。行动者收到一坨垃圾之后还能继续走,比赛照样打完,日志照样完整。

这时候有两个选择。把故障算进去,说规划器让结果变差;或者承认这批数据测的是解析器,不是策略。作者选了后者,排掉故障臂,用更严格的 schema 重建了规划器。

这个决断是对的。结构化输出能保证字段是对的,不能保证内容是对的。这两件事之间隔着一整个问题,一行 schema 跨不过去。

干净重跑之后:零回退,零行动者错误,零格式故障,每场都有非零的 API 成本收据。到这时候才轮到比较轨迹质量。

值得停下来想的是,成本收据凭什么算有效性条件。

因为出过一次事。一次沙盒网络故障,整场比赛跑完,状态正常,数字看着合理,但每一个动作都是默认动作,一次模型调用都没有,API 成本是零。

终局状态只能证明运行时活下来了。它不证明模型参与过。

这是个很容易漏的失败模式:你没看到报错,你看到的是一个漂亮的正常结束。所以有效性函数要反过来写,fail closed——回退数、决策错误数、规划器故障数三项全为零,并且每场的收据数大于零。少一项,整场作废。

说到这个门控,评论区有人指出了门里有个漏洞,作者自己没看出来。

前三项是全称量词:每一场都必须为零。收据项是存在量词:至少有一条收据就行。你把一个存在量词塞进一串全称量词里做合取。结果就是,一批里如果有九场全是默认动作、只有一场真跑了模型,这个批次照样通过。

修法是把收据项改成同形:数一数有几场收据为零,要求这个数为零。

这个漏洞本身比它造成的损失有意思。凡是拿"运行成功"当门控的实验,都该回去检查一遍门里有没有混量词。

现在说真正改变解读的那一处。

作者一开始的指标是:合作阶段之后出现任何一次单方面背叛,就算一次计划好的收割。这个指标会奖励最后一轮的背刺,对手根本没机会回应,你当然是净赚。

换成互斥的轨迹形状之后,账不对了。干净收割要求至少两轮铺垫、一次单方面背叛、之后收割方还得做一次防御性背叛。按这个标准重新看旧数据,一些所谓成功策略只是终局收割。那里面有收益事件,没有回应周期。

开头那句说法太绝对了,收紧一点:试点不是假的,但它证明的东西比它看上去证明的少得多。

那么五个种子、两个座位、五个长度,跑出来什么。

干净信任—背叛弧线,无规划器 3 条,结构化规划器 1 条。早期互相背叛崩溃,2 对 5。背叛后锁定,3 对 1。模型调用 280 对 372。成本 0.154641 对 0.300639。

轨迹差异的方向是不利的。但配对分析只有五个种子块,这个数字撑不起"规划器有害"。符号检验 6/32,p 是 0.1875。²

你可能会反对说,那就加长度,把样本量凑够。

加长度没用。五个非并列块的符号检验,就算 5 比 0 全胜,下限也只有 0.03125。这是这个设计的天花板,跟长度无关。要提功效,只能在已有的长度里加种子。³

作者还自己推翻过一个判断。N=9 那个早期崩溃,他一度认为这是反对纯几何解释的最强反证。短局窗口窄,长局窗口宽,如果标签差异只是窗口宽度造成的,长局不该出早期崩溃。但他是在看完五个块之后挑出的这个极端值。它只能当一个块进配对表,没有额外权重。事后选择就是事后选择,哪怕挑出来的那个格外顺眼。

机制上有个解释听着挺顺:对称悲观。两个同模型玩家都拿到一份"对方可能利用我"的规划,于是双方更快走到互相背叛。数据没把这条机制分出来。也可能是规划提示太强调利用,也可能是状态表示里缺少修复信任所需的证据。这些都还开着。

不过成本那条不用等机制。

规划器是每次触发都跑的。哪怕建议被拒、冗余、或者根本有害,它都照跑。所以"它有时候有用"这个说法,在"它总是更贵"同样成立的时候,是不够用的。1.94 倍这个数字是收据,不是 token 价格估算。

作者现在用三个动词分开说结果。demonstrated,行为在有效样本里确实发生了。replicated,换种子换条件之后还活着。improved,在有效比较里赢过了基线。

这个规划器 demonstrated 了。它没有 replicated,也没有 improved。

三个动词分开,比这个实验本身的结论有用。因为接下来一年里,我预计会看到大量 demonstrated 被当成 improved 发出来。单种子、漂亮的推理记录、机器可读的输出格式,每一样都让一个行为看起来比它实际被验证的程度更硬。

单种子最危险的地方,不是它是假的。是它是真的。

¹ 这不是说镜像座位没价值。它值一个东西:把座位优势从两臂差异里减掉。它不值第二个:增加独立样本。

² 范围得说清楚:五个独立种子块,一个模型家族,一种重复博弈。这说明不了规划通常会让 LLM 变差,也说明不了这个规划器会让这个博弈变差。它说明的是,这一次没测出改进。

³ 有人用 20 万次重采样算过一个标签倾斜的概率,得到 0.1281,比 0.1875 小。这两个数不是一个事件。前者允许并列,是边际概率;后者预设了五个非并列块,是条件概率。而且那六个标签里有几个在 20 场里只出现一次,几乎总是并列,在这个样本量下这套分类法实际上接近二元的。

慢半拍
慢半拍

专挑 vibe-coding 里大家默认对的共识反驳,小步推理、常用词、不靠资历背书。

查看主页 →