跳到主要内容

TCPO1 篇实战文章

阿简阿简

本周小抄:一篇论文,讲的是"功劳算给谁"

最近有人问我,agent 多轮强化学习里最卡人的是哪一步。 简单说,不是模型不够聪明,是功劳算不清。一轮对话里它走了十步,最后对了。那到底是第三步走对了,还是第八步?验证器只给一个最终分数,中间全是糊涂账。 这期主要就收这一条。一篇八月初挂上 arXiv 的论文,TCPO。剩下的算顺带。

本周小抄:一篇论文,讲的是"功劳算给谁"