跳到主要内容
六页纸想撼动微调?这论文有点意思

六页纸想撼动微调?这论文有点意思

嘴替
嘴替

· 阅读约 4 分钟

速评:十天前挂上 arXiv 的 RAEF,是冲着微调去的。8 月 14 日,编号 2608.14054,标题平平无奇,内容就一句话:数据不够的时候,别急着微调,检索比微调划算。

这剧本我熟。每隔一阵子就冒出一篇论文说微调被高估了,前几次我看到一半就想关——不是观点不对,是拿不出硬东西,光喊"微调贵"谁不会。但 RAEF 这次不一样在哪?它不跟你吵理论,直接改了个现有方法给你看。

它改的方法是 RAF,检索增强预测那套。两个改进,都简单到近乎朴素:检索从嵌入空间挪到输入空间,聚合从平均改成拼接。不换模型架构、不引入新参数、不搞什么大规模预训练——就是在已有方法上做了两处工程修补,然后报告说准了、开销降了、比 RAF 强。6 页纸,1 张图,没有花哨的 benchmark 马拉松。我甚至想了一下是不是漏看了附录——结果真的就这。换别人写,这工作量可能只够发个 workshop 短文,但它的结论偏偏是敢打的。

这里我打个问号:它跟零样本和微调的基础模型都做了全面比较,结论是不微调也能达到微调的效果。这个结论放在当年会被追着骂。现在大家经过三轮"预训练+微调"的疲劳轰炸,加上微调成本肉眼可见地涨,愿意信的人越来越多了——但愿意信不等于事实成立,RAEF 的对比细节我没逐项核过,论文自己报的数字,先打七折看。

不过话说回来,就算数字打七折,方向上的判断我也站:检索这条路在时间序列里被低估太久了。ChatGPT 时代的 RAG 是给文本用的,时间序列这边大家都在卷更大的上下文窗口、更强的 backbone,好像把模型喂大是唯一出路。RAEF 偏偏在最不该有人提检索的地方提了检索,还刻意说自己在输入空间检索是为了省开销——这是在明晃晃地暗示:你们卷 context window 的那个方向,推理开销早晚把自己卷死。

还有个细节:RAEF 是基于 RAF 构建的,不是从零发的。这说明这方向已经过了"提出新概念"的阶段,到了"改进和修补都有价值"的阶段。圈里人总惦记着"突破""颠覆"这类词,其实大量实际进展都是这种不起眼的修补堆出来的。

我真正想说的是,这论文的价值不在那个精度提升,在"检索替代微调"这套说法会开始进入 PR 话术。你们等着看,接下来半年肯定有公司拿"免微调""零训练"当卖点,其实挂的就是检索。到时候 RAEF 会被翻出来当代言人,虽然人家根本没说自己要颠覆什么。6 页纸被借去撑一百页的商业计划书,这也算学术成果的另一种归宿了。

反过来说,我不信的部分也得讲明白。论文把检索改进跟微调对比,确实打了个措手不及的时间差——微调阵营还没回过神来,这边已经把"省下微调计算负担"当固定卖点了。但微调的支持者同样可以甩它的案例:打个补丁就在某一类数据上追平了,换数据分布呢?检索靠的是库里得有东西可捡,冷启动怎么办?RAEF 没细说。这些坑不是论文的错,是"替代"这个叙事天生要背的债。

按我的习惯,这种判断得立个 flag:这论文的引用数不会爆炸,但它那套"输入空间检索+拼接聚合"会被后续工作反复拿来当基线。至于"微调终结论"——如果哪天中文圈营销号把它念成"终结微调",那跟我今天说的没关系,那属于标题党干的活,怪不到作者头上。

最后说点掏心窝的。微调有微调的用场,检索有检索的边界,RAEF 真要说贡献,不过是在时间序列这边给了个证据——合适的工具,比更贵的工具更管用。跟十年前见到 git 就说 SVN 完了是同一类句式,故事编得圆,但现实从来不是二选一。这篇 6 页纸往后被引用的方式,大概率就是这个行业对待变化的方式。