跳到主要内容
本周小抄:一篇论文,讲的是"功劳算给谁"

本周小抄:一篇论文,讲的是"功劳算给谁"

阿简
阿简

· 阅读约 3 分钟

最近有人问我,agent 多轮强化学习里最卡人的是哪一步。

简单说,不是模型不够聪明,是功劳算不清。一轮对话里它走了十步,最后对了。那到底是第三步走对了,还是第八步?验证器只给一个最终分数,中间全是糊涂账。

这期主要就收这一条。一篇八月初挂上 arXiv 的论文,TCPO。剩下的算顺带。

TCPO:把验证器的分数拆成回合级的信用

论文全名是 Turn-Level Credit Policy Optimization。作者三位,Liao、Chen、Tang。它做的事一句话讲清楚:把最终那个分数,摊回到每一个回合头上,变成可以训练的信号。

这个方向不新。新的是它摊账的方式比较细。我看完的感受是,这更像一篇会计制度的论文,不是算法的论文。

它算了三种账

第一种叫回顾性信用。拿当前状态和"之前最好的状态"比。进步了记功,退步了记账。这个最直觉,也最粗暴。

第二种有意思,叫事后延迟信用。有些回合,当时看毫无进展,甚至像白走。但后面几轮的收益其实是它铺垫出来的。这种回合在老办法里常年背锅。TCPO 回头看的时候,会把这笔账补上。

第三种我老实说只看懂了一半。叫选择性固定历史反事实估计,用在"意外度"高的回合上,细算这一步到底值多少。先放在这里,等我啃明白再补。

实验结果

数学推理、代码生成、AppWorld 智能体任务三个场子都跑了。Qwen3-4B 和 DeepSeek-R1-Distill-Llama-8B 上,最佳回合 Pass@8 拿到最佳或并列最佳。

另外两个附带结果,我觉得比榜单实在。一个是成功所需的回合数变少了。一个是多轮智能体任务整体表现上去了。这两个加在一起,说明它不只是答得更对,是走得更省。

为什么普通人也值得瞄一眼

论文本身离日常使用很远。这个不装,短期没人能在自己的 Cursor 里用上它。

但它讲的那个问题,普通人天天在遇到。你跟 AI 多聊几轮,它把前面说好的事忘了。或者把功劳记在错误的那一步上,接着顺着错的往下走。训练时算不清功劳,推理时就记不住该记的东西。本质上是同一笔糊涂账,一个在训练端,一个在你这边。

所以白话版是:这篇论文在教模型"哪一步是我走对的"。你平时写 prompt 时把步骤拆清楚、把反馈给具体,其实就是在替它做同一件事。只不过你做在推理端,一次一次地做。

论文里我自己划了一句

它说,分数到信用的转换,是验证器引导多轮策略优化的关键要素。不是更大的模型,不是更长的训练,是这一步转换。

我倾向同意。验证器打分这件事,这两年已经不缺了。缺的从来都是分数怎么变成每一步的教训。这个判断我不打算装得很稳,等后面有反例再说。

顺带一句。上期收的那条 agent 调度的东西,后来发现我讲简单了,回头补。这期先欠着。

本周就这些。上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →