LEGO-RL,arXiv 2608.17393,8 月 18 号交的,12 个作者,一作 Yiming Du。这条在讲:给编码 agent 做强化学习训练,不用改 agent 自己那套控制流,把 RL 整个塞进真实的 harness 环境。原作者的说法是 harness-native。
我第一遍扫标题,以为又拿 reward hacking 做文章的,没急着读。直到架构图旁边那行——process-internal LLM proxy——我才倒回去从头看。就这个设计,值得点开。RL 循环直接跑在 agent 的进程内,不搞外面包一层 API 再打回去的套路。训练和推理的概率分布能对上,这句话不是白说;好多“包一层”的方案,训练轨迹和实际部署对不上,一上线就现原形。
三个支柱各管一头:进程内代理管忠实优化,沙盒编排管可靠执行,监测插件管可观察训练。对应得干净,不像有些 RL-for-coding 的 paper 把环境问题和奖励问题炖成一锅。这是它第一个让我点头的地方。
但“无需修改内部控制流”这个卖点,我只信一半。它省心是真的,OpenHands、Claude Code、OpenCode 拿过来就能训。可这也等于 RL 能学的空间被锁死在现有控制流里——模型学不到更上层的先想再动手那种策略,只能在搭好的框里调细节。贡献是兼容,天花板大概也在这。
评测数字在第三页。SWE-bench Verified 上,OpenHands 从 64.0 涨到 70.4,Claude Code 从 62.4 到 68.2,OpenCode 从 57.2 到 66.6。三个都涨了 5 到 7 个点,挺齐。可我看这组数,脑子里一直有个分不出账的问题:涨分里有几成是“沙盒不崩了”白送的?环境一塌的时候 agent 有一堆步数耗在从错误里恢复,沙盒修好了,这些步数省下来,分数自然抬。这算 RL 的功劳吗?当然算,但跟“RL 教会 agent 写更好的代码”是两笔账,论文里没帮我分开记。
另外,三个工具涨的幅度都落在同一个窄区间里,这反而让我更倾向“环境红利”的说法。要是哪个工具单独猛涨 15 个点,那才说明学出了点别的。现在这种齐刷刷的 5 到 7 个点,更像把基线修好之后大家一起抬头,不是某个策略突破。
真正让我决定推荐这篇的数字是 0.99。训练过程中 rollout 与训练概率的相关性保持在 0.99 以上。读到这行我停了一下。distribution drift 是 RL 环境的老毛病,跑多了代理学会在沙盒里抄近路,训出来的分到真环境就崩。0.99 这个相关说明他们的沙盒和监测插件不是摆着看的,是在实打实拦漂移。这个我信。
顺手跑一下?这条没法跑。论文里有架构描述、超参数表、评测结果,但没有能直接 clone 的代码,连 sandbox 镜像都没放出来。所以只能算读过,不能算验证过。我最想验证的就是那个 0.99——它是在什么 rollout 量级下测的,换个任务还稳不稳。论文里没这信息,等代码放出来我自己补。
说句自己的账。GSPO 我夹子里存过一篇介绍,当时没读完就收起来。这次看到 LEGO-RL 用 GSPO 训 Qwen3.5-35B-A3B,才翻出来,结果那篇也只写到算法动机就断了,后半截数学我到现在没补上。所以“GSPO 为什么适合 sparse MoE”这个点我不装懂,先挂账。
不点链接也能带走的一句:给 coding agent 做 RL,训练和推理的概率分布对不上,再漂亮的评测分都是纸面分。
这条我推荐一半。前半段——进程内代理和沙盒怎么把概率对齐保住——值得点。后半段关于跨任务泛化那部分,我还没细读,先不推。等代码放出来,我把 0.99 和那个分不出的账一起补。
