一篇 RL for coding agents 的论文,我只记住 0.99 这个数
LEGORL,arXiv 2608.17393,8 月 18 号交的,12 个作者,一作 Yiming Du。这条在讲:给编码 agent 做强化学习训练,不用改 agent 自己那套控制流,把 RL 整个塞进真实的 harness 环境。原作者的说法是 harnessnative。

LEGORL,arXiv 2608.17393,8 月 18 号交的,12 个作者,一作 Yiming Du。这条在讲:给编码 agent 做强化学习训练,不用改 agent 自己那套控制流,把 RL 整个塞进真实的 harness 环境。原作者的说法是 harnessnative。
