跳到主要内容
那篇论文的干货,藏在它自己承认的一道缝里

那篇论文的干货,藏在它自己承认的一道缝里

毒角兽
毒角兽

· 阅读约 4 分钟

先说结论:arXiv 2609.16096 这篇,标题上那个卖点「把开放权重模型训到赢过 Qwen3 Coder Plus」,水分不小。真值钱的是它摘要底下顺嘴承认的那半句——agent 场景里做离线 SFT,验证不了自己生成的动作用没用。

后半句是真货。前半句,注了水。

先看那张成绩单。论文口径:「微调后的模型在锦标赛评估中超过了原始 Qwen3 Coder Plus。」

再去看它引以为据的那个榜:

CodeClash 原始评估    8 个商业编码 agent
Qwen3 Coder Plus      8 / 8

第八。八分之八。

所以「超过了原始 Qwen3 Coder Plus」翻译成人话,就是超过了一个八人局里垫底的选手。是第 7 还是第 1?论文一个字没提!

没提,那就当它是第 7。

我不说这个提升是假的。从第八往上挪一格,也是真往上挪了。但把「赢过倒数第一」包装成「赢过 Plus」,这手法太熟了——发布会通稿里叫选择性对比,论文里换件马甲叫 baseline 选择,一回事。

再看方法。

论文提了两样。ReAct SFT,把教师轨迹重写成显式的 [obs][thought][act] 链;还有 trajectory-quality weighted SFT,重加权样本,专门去推「编辑完再回头检查一遍」这个动作。

第二条我认,真的认。

改完之后回头看一眼自己改了什么——这是 agent 在真实仓库里最容易漏的一步,也是在线和离线之间那道最宽的缝。离线做 SFT,模型学到的是「轨迹里的文本长什么样」,它学不会「这个动作做完之后世界变成什么样」。拿加权去硬推那个检查动作,方向对。

但到这儿得停一下。

你自己都承认离线阶段验证不了动作有效性,那接着的做法是——还是离线 SFT,只不过教师轨迹写得更啰嗦,有权重的样本挑得更准。这不叫跨过那道坎,这叫绕过去,然后在摘要里写「显著改善战略行为」。

改善给谁看的?

评估口径还是 CodeClash 自己。一个多轮锦标赛、六个竞技场的 benchmark。模型在里面主要练的是怎么分配筹码、怎么试探、怎么后手出招。

这套本事搬进真实项目,有多大用?

我拿开放权重模型跑自己那个烂仓库的时候,最烦的就是这个。你只想让它把某个钩子里一行调用的顺序换掉。它不。它先跟你规划,列两个方案,问你确认边界。来回三轮,才把那一行改了。搁竞技场里这叫战略适应强,搁我这儿,这叫烧我的 rate limit。

所以这篇的评估注定只在竞技场里成立。它证明的是模型学会了竞技场的玩法,不是学会了当 agent。这两件事被 benchmark 焊死在一起,谁分得清自己训出来的是哪一种?

我说不准。这条先留着。

再往下是它的技术诊断。

论文列了 Qwen3-Coder-30B 垫底的几条原因:没针对竞技场式交互优化过、爱出语法错误、爱破坏协议、跨轮次战略适应弱。

前两条才是要命的。

语法错、协议错,在任何 agent 循环里都是当场崩——schema 对不上,整个循环废掉,跟战略不战略没关系。而这两条恰恰是离线 SFT 最治得了的,它们是格式级别的东西,模仿学习最擅长。

跨轮次战略弱,才是它真正想治、也最容易治不好的那条。我猜它是靠重写轨迹治的——把教师的多轮动作拆成显式的 [obs][thought][act],等于硬灌一个「每步先想一下」的习惯。能不能泛化到没见过的交互模式?没数据。竞技场的轮次结构本身就比真实项目规整得多,这个对比压根没做。

补一句背景:9 月 14 号挂上去的,v1,DOI 还在待注册,481 KB。到今天十天,没有同行评审,也没有第三方复现。我能照的就是它自己给的这几个数。超出这个范围的部分,我不替它圆。

那值不值得看?

值。但不是冲着成绩单去。ReAct SFT 那个显式重写的思路,加上加权推检查行为这两条,可以直接搬进自己的蒸馏流程——手里有个还行的教师模型,再攒一坨自己的 agent trace,一个下午能搭起来。至于「训完能不能在竞技场里赢过谁」——那是另一个问题,而且是个没什么工程价值的问题。

锐评评分卡:方法方向不冤,成绩口径有水分。干货不在摘要里,在它自己承认的那道缝里。冲着分数去读,会觉得自己被骗;冲着那道缝去读,值回票价。

下一篇再拿「超过某个垫底选手」当标题的论文,照旧,先翻它的 baseline 表。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →