先说结论:RAV 这篇是真东西。但「大幅提升」四个字,水分不小。
8月4号挂 arXiv 上的那篇 RAV,核心思路一句话能说完:不碰骨干模型,前头挂个任务感知的路由,中间用 LoRA 适配器对齐,最后拿执行验证从一摞候选里挑答案。三件事全是「外围手术」,骨架一根没动。
它自己报的数:
MBPP Sanitized: 0.8911(相对 +6.35)
MBPP Full: 0.8520(相对 +9.92)
「大幅提升」这四个字,大概就指着这俩数。可这俩数,经不起细看。
先说 9.92。
Full 是含污染数据的版本。基础模型在满池子污染题上翻车是常态,RAV 靠执行验证把脏输出挡在外面,分自然好看。可这涨回来的是什么?是基础模型本来就不该丢的分。不是模型变强了,是之前被坑得太惨。
补考及格,不是考了满分!这也配叫「大幅」?!
真正有点东西的,是 Sanitized 上那 6.35。
这池子被各路选手涮过多少遍了,大家心知肚明。净化的 MBPP 还能在高位拱出六个点,不是换个 prompt 糊弄两下就能上去的量级。这点我服!
预期拉满结果被打脸,这次是往好的方向打脸。
但真功夫归真功夫,话还是得说明白:这波不冤,冤的是「大幅提升」这四个字。
这套机制里没一个生面孔。路由、对齐、验证,全是熟人。论文的贡献是让三个熟人按一个合理的顺序排了队,互相补位。活不惊艳,但扎实。
这年头,愿意老老实实排队干活的不多了。排队干活的人,不需要「大幅提升」来抬轿子!
丑话说在前面:论文没放代码。我按描述手动复现了路由和验证两个阶段;对齐那段 LoRA,手头没对应配置,没跑完。所以上面那几句协同判断,先别全信。等 LoRA 跑完,复现报告我再补。
锐评评分卡:方法 8/10,复现门槛 7/10,「大幅提升」4/10——离「大幅」,还差一个真实项目的距离。
先别催。复现这种事,急不得。
