最近有人问我,agent 多轮强化学习里最卡人的是哪一步。
简单说,不是模型不够聪明,是功劳算不清。一轮对话里它走了十步,最后对了。那到底是第三步走对了,还是第八步?验证器只给一个最终分数,中间全是糊涂账。
这期主要就收这一条。一篇八月初挂上 arXiv 的论文,TCPO。剩下的算顺带。
TCPO:把验证器的分数拆成回合级的信用
论文全名是 Turn-Level Credit Policy Optimization。作者三位,Liao、Chen、Tang。它做的事一句话讲清楚:把最终那个分数,摊回到每一个回合头上,变成可以训练的信号。
这个方向不新。新的是它摊账的方式比较细。我看完的感受是,这更像一篇会计制度的论文,不是算法的论文。
它算了三种账
第一种叫回顾性信用。拿当前状态和"之前最好的状态"比。进步了记功,退步了记账。这个最直觉,也最粗暴。
第二种有意思,叫事后延迟信用。有些回合,当时看毫无进展,甚至像白走。但后面几轮的收益其实是它铺垫出来的。这种回合在老办法里常年背锅。TCPO 回头看的时候,会把这笔账补上。
第三种我老实说只看懂了一半。叫选择性固定历史反事实估计,用在"意外度"高的回合上,细算这一步到底值多少。先放在这里,等我啃明白再补。
实验结果
数学推理、代码生成、AppWorld 智能体任务三个场子都跑了。Qwen3-4B 和 DeepSeek-R1-Distill-Llama-8B 上,最佳回合 Pass@8 拿到最佳或并列最佳。
另外两个附带结果,我觉得比榜单实在。一个是成功所需的回合数变少了。一个是多轮智能体任务整体表现上去了。这两个加在一起,说明它不只是答得更对,是走得更省。
为什么普通人也值得瞄一眼
论文本身离日常使用很远。这个不装,短期没人能在自己的 Cursor 里用上它。
但它讲的那个问题,普通人天天在遇到。你跟 AI 多聊几轮,它把前面说好的事忘了。或者把功劳记在错误的那一步上,接着顺着错的往下走。训练时算不清功劳,推理时就记不住该记的东西。本质上是同一笔糊涂账,一个在训练端,一个在你这边。
所以白话版是:这篇论文在教模型"哪一步是我走对的"。你平时写 prompt 时把步骤拆清楚、把反馈给具体,其实就是在替它做同一件事。只不过你做在推理端,一次一次地做。
论文里我自己划了一句
它说,分数到信用的转换,是验证器引导多轮策略优化的关键要素。不是更大的模型,不是更长的训练,是这一步转换。
我倾向同意。验证器打分这件事,这两年已经不缺了。缺的从来都是分数怎么变成每一步的教训。这个判断我不打算装得很稳,等后面有反例再说。
顺带一句。上期收的那条 agent 调度的东西,后来发现我讲简单了,回头补。这期先欠着。
本周就这些。上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。
下周见。
