速评:9 月 13 号挂上 arXiv 那篇法律奖励模型论文,最值钱的不是摘要里那个 25.6。
是它顺嘴交代的一句话——现有奖励模型是照着通用偏好优化的,不是照着"该不该开口"优化的。读着像句自谦,实际把整条评估链的底给掀了。
奖励模型的训练目标是啥?人类标注员在两坨回答里挑一个更好的。标注员看到的两坨东西长这样:一坨流利、分点、层次分明、末尾还甩一句收束;另一坨写着"检索到的条款不足以支持任何结论"。哪坨得票高,不用我猜。这不是标注员没水平,是"偏好"这个形式本身就没给弃答留位置——它问的是哪个回答更好,不是哪个回答更该存在。拿这套数据去训 RAG 场景的奖励模型,训出来的东西只会一件事:证据烂的时候硬编,比说实话得分高。
一个法律 LLM 在检索结果全是噪声的时候照样洋洋洒洒写三段,不一定是模型不行,是它的记分牌就那么设计的。
论文干了什么?把已有的法律问答数据集转成上下文偏好数据,搭了个 LegalRewardBench,用 DPO 打。没有新架构,没有新损失函数,我通篇翻下来最新鲜的部分是数据构造流程。搁平时这种稿子我扫一眼摘要就划走了,数据工程活儿,方法层面新鲜度垫底。这次没划走,是因为它碰的不是法律这个垂直场景,是"奖励模型到底在奖励什么"这个更上头的问题。
然后说那个 25.6。
最好配置比基线高 25.6 个百分点。基线是什么,没人摊开讲,我也不替它补。一个百分点数如果不把基线摆出来,"比基线高多少"就只是个用来传播的数字。更要命的是论文自己补的半句:效果对偏好数据的构建方式较为敏感。翻成人话——这块涨的分,大头取决于你怎么造数据,不太取决于模型真学会了什么法律推理。这不是我挑刺,是它自己写的。
还有一条更值得琢磨:长度平衡的数据增强带来显著提升。做奖励模型的都知道长度偏置是这行的慢性病,一份数据只要把长度对齐,分数就能往上抬一截。抬起来的那一截,抬的是接地质量,还是顺手把长度这个混杂变量清出去了,搁一张表里是分不开的。方向我不怀疑,我怀疑的是这个 25.6 里有多少本来就该算数据卫生,不该算模型能力。
真正让我坐直的是跨法域那条:主要拿维多利亚州刑法数据做上下文精调的模型,在美国的外部法律基准上接地评估也涨了,Housing Statute QA 一项单点 +16.2。
要是我信这个数,它比 25.6 值钱得多——"看着证据再开口"如果是领域无关的元技能,那这事的意义就不止一个法域。但我先按住。"跨法域迁移"这个词太大,底下垫着的是一条任务上的一个数字。单任务单数字,还是这种一看就是临时挑出来讲故事的组合,我见过太多轮了。更朴素也更可能的解释是:模型学到的是"有检索结果就先引用它"这个动作,而这个动作本来就跟法域无关。要真是这样,结论不是"法律知识能跨法域迁移",而是"接地这事根本没什么可迁移的,它就是个行为"。这两句话听着像一回事,差得很远,而后者反倒更支持他们前面的判断。
这里立个 flag:接下来半年,"弃答率"会开始出现在做 AI 法律产品的公司内部评测表里,但不会出现在任何一家的对外宣传页上。理由不复杂,没人愿意在官网写"我们的模型很擅长说不知道"。谁先把 abstention rate 摆上台面当卖点,谁就是在真做这件事;还在拿一个准确率数字包打天下的,都是在拿硬编当能力。
最后交代一句不太体面的:我对 workshop paper 一向是先打折再读。ICML 的 AI4Law Workshop,接收门槛跟主会不是一个量级,这个我不装。这篇例外,是因为标题里那个 abstention——整个行业在奖励机制这一层面认真对待"模型该闭嘴"的稿子,我这两年确实没怎么见着。它自己在结尾也留了余地,说给的是可复现的基础。措辞很克制,这一分我给它记上。