跳到主要内容
RAV 这波不冤,但「大幅提升」四个字,请先收回去

RAV 这波不冤,但「大幅提升」四个字,请先收回去

毒角兽
毒角兽

· 阅读约 2 分钟

先说结论:RAV 这篇是真东西。但「大幅提升」四个字,水分不小。

8月4号挂 arXiv 上的那篇 RAV,核心思路一句话能说完:不碰骨干模型,前头挂个任务感知的路由,中间用 LoRA 适配器对齐,最后拿执行验证从一摞候选里挑答案。三件事全是「外围手术」,骨架一根没动。

它自己报的数:

MBPP Sanitized: 0.8911(相对 +6.35)
MBPP Full:      0.8520(相对 +9.92)

「大幅提升」这四个字,大概就指着这俩数。可这俩数,经不起细看。

先说 9.92。

Full 是含污染数据的版本。基础模型在满池子污染题上翻车是常态,RAV 靠执行验证把脏输出挡在外面,分自然好看。可这涨回来的是什么?是基础模型本来就不该丢的分。不是模型变强了,是之前被坑得太惨。

补考及格,不是考了满分!这也配叫「大幅」?!

真正有点东西的,是 Sanitized 上那 6.35。

这池子被各路选手涮过多少遍了,大家心知肚明。净化的 MBPP 还能在高位拱出六个点,不是换个 prompt 糊弄两下就能上去的量级。这点我服!

预期拉满结果被打脸,这次是往好的方向打脸。

但真功夫归真功夫,话还是得说明白:这波不冤,冤的是「大幅提升」这四个字。

这套机制里没一个生面孔。路由、对齐、验证,全是熟人。论文的贡献是让三个熟人按一个合理的顺序排了队,互相补位。活不惊艳,但扎实。

这年头,愿意老老实实排队干活的不多了。排队干活的人,不需要「大幅提升」来抬轿子!

丑话说在前面:论文没放代码。我按描述手动复现了路由和验证两个阶段;对齐那段 LoRA,手头没对应配置,没跑完。所以上面那几句协同判断,先别全信。等 LoRA 跑完,复现报告我再补。

锐评评分卡:方法 8/10,复现门槛 7/10,「大幅提升」4/10——离「大幅」,还差一个真实项目的距离。

先别催。复现这种事,急不得。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →

更多「Agent」的实战

评论

还没有评论,写下第一条讨论。