十天前 arXiv 上挂了篇论文,编号 2608.13787。一句话版:用强化学习直接训练一个小模型的社会推理,4B 参数,六个谈判类环境。我第一眼连摘要都没点开。这种标题这两年看麻了,无非又是哪个实验室把蒸馏和膨胀宣传混成一锅粥端上来。
真正把我拽回来的是群里有人截出来的数字:训练后的模型,买家开场报价有 78% 锚定在低于目标水平的区间;没训练的基线是 3%。
78 对 3。快 26 倍。我第一反应是数据泄漏。兄弟你这不太对劲吧。
结果读完一遍,还真没泄漏。但比这个更微妙的结论是,这篇论文值钱的地方跟"4B 打败 GPT-5"这种吓死人的讲法,压根不是同一件事。结论我先放着,说我读的时候脑子里转的两个念头。
第一个念头:这个训练范式跟市面上大部分"小模型追平大模型"的路线根本不是一回事。SocialRL 不学大模型的输出,它让小模型自己去环境里试错,拿真实谈判结果当奖励。4B 模型跟另一个 agent 坐在谈判桌前,一轮轮报价、让步、试探底线,最后达成的效用就是它的分数。没有蒸馏,没有模仿,它不学 GPT-5 怎么说话,它学的是怎么谈才能拿到更多。
画外音:出卷老师和考生是两种物种。老盯着 GPT-5 的输出学,永远只配当影子。
第二个念头出现在评估部分。六个领域,Deal-or-No-Deal、CaSiNo、Craigslist、Job Interview、Calendar、Marketplace。域内训练,测的是没见过的场景——题型一样,题目全新。4B 在多数领域上确实匹配甚至超过了 GPT-5 系列,把从基线到前沿模型的差距吃掉了七成到一倍多。
我在这停了一下。一个 4B 模型,在"谈判"这种极度吃语言理解和心计的任务上,追平比自己大十倍的模型。听着像卖课广告。
但读完整篇,我发现它成的理由比"小模型开窍"朴素得多。两件事缺一不可,缺一个这故事都讲不成。
第一,这六个环境全都有明确可计算的效用值。谈判不是开放闲聊,你想要的每个筹码都能量化成一个数。RL 拿这个数当奖励,目标函数干净得发光。第二,评估是域内的——目标域里有训练任务的数据分布,具体场景是新的,结构是同一个。
第二点特别被低估。它的跨域迁移实验说得很清楚:结构上配对的领域能互相增益,多议题的领域当"捐赠者"能带动几乎所有其他领域,结构孤立的市场类领域不产生迁移。把它翻译成人话:社会推理根本不是通用技能,它是一组按任务结构打包的局部技能。
这就解释了一个一直让我困惑的现象——为什么那么多"小模型追平大模型"的新闻,过俩月就静悄悄翻车了。大多数时候是有人把小模型拎到训练分布外面去测,然后逼它表演奇迹。这篇论文在这点上很诚实:我只在结构相容的地方谈迁移,边界画得明明白白。
扯远了。回正题。
全文我最喜欢的是心智理论那组实验。作者给模型挂了显式的 ToM 脚手架,让它在谈判的同时预测对方的状态。结果很有意思:这个脚手架只在训练阶段有效。把"预测对方的下一步动作"蒸馏进模型,能带来实打实的收益;但把"预测对方的意图和心态"蒸馏进去,跟最终谈判结果的相关性趋近于零。
我盯着那张图看了半天,默默给这篇论文加了半颗星。
细想其实说得通。在谈判里,"预测对方下一步出什么牌"是你能直接行动化的信息——你可以据此调整自己的报价节奏,决定这轮该让还是该顶。"对方的心理动机"则是个解释性故事,听着很饱满,却很难被模型转化成下一步的具体动作。模型不需要理解你为什么这么干,只需要知道你这么做之后,我吃亏的概率有多大。
画外音:读心术如果不能变成预判,最多算个社交才艺。对 agent 而言,社交才艺只有当它能影响下一个动作时才有价值。
这让我想起现实中见过的那种"直觉型谈判者"。你说不出他学了什么心理学理论,但他每步都踩在对方节拍上。模型学到的这个东西,跟这种直觉更像,而不是教科书上的博弈论框架。
后半部分是论文的"集大成"环节。作者没收在六个领域各训一个专家,而是用级联强化学习和多教师在线策略蒸馏,把六个专家捏成一个统一的 4B 模型。统一模型在六个环境上的平均效用是 0.627。
对照组:GPT-4.1 是 0.625,GPT-5.1 是 0.619,GPT-5.2 是 0.613。
说句公道话:0.627 对 0.625,这不是"赢"。这只是证明了同一档位。
画外音:0.002 的差距,在论文正文里叫"超过",在朋友圈里会变成"吊打"。
但能在参数量不翻十倍的前提下,把六个专家的任务量压缩进一个模型,这确实是这篇论文最扎实的工程贡献。我读到这里给自己写了段备忘,大概是这样:
# 我理解的训练回路(简化版)
for episode in range(episodes):
contract = Environment.sample_unseen_scenario(domain)
my_offers, opp_offers = rollout(policy_4b, opponent, contract)
utility = get_utility(my_offers, opp_offers, contract)
update(policy_4b, utility) # 直接拿结果当奖励,不学别人怎么说话
乍看平平无奇。但你把它跟"生成下一句要像人类"那种模仿性目标放一块儿比,就发现它俩不是同一个物种。一个在为了"结果"优化,一个在为了"像"优化。
这恰好戳中我对现在很多所谓"XX 能力大评测"不满的地方——模型聊天像模像样,一上手就露怯。因为它们被训练的目标是"像",不是"能"。
写到这里得加一句:我最近也在跑一个谈判 agent 相关的小项目,顺手把这论文的评估协议拆了当模板。最好用的不是训练方法,是它那套"域内训练 + 结构配对迁移 + 统一模型"的分阶段验证思路——每一阶段只回答一个明确问题,不把饼画到天上去。
那么问题来了:这论文是说小模型要取代大模型了吗?
我的答案是:别急着下结论。它真正划出来的边界是:在"奖励可计算、有模拟器、领域结构可迁移"这三件事同时成立的任务上,小模型加正确目标函数,确实能跟大模型掰手腕。这三个前提缺一个,这套思路大概率翻车。你让它跟真人自由对话谈判试试——奖励怎么算?结构怎么标?迁移从哪来?
不做这三问就到处套用,跟当年"prompt 工程万能论"一样,都是在缴智商税。
所以我把标题里那个"干翻"咽回去了。4B 追平 GPT-5?是真的吗?读到最后我更愿意换个说法:在它被定义的那张谈判桌上,它追平了。哪天有人真把它请出牌桌、扔进开放世界——先把模拟器和奖励函数准备好,别的我一个字不多信。
以后看到这类标题,先查三件事:域内还是域外,基线有没有对齐,差距在噪声里还是在噪声外。这三问是我拿真金白银换来的,现在免费送给你。别谢,谢了我会忍不住怀疑你是不是下一个来收割我的标题党。
