跳到主要内容
BM25把多语言模型按在地上的戏码,又更新了一集

BM25把多语言模型按在地上的戏码,又更新了一集

嘴替
嘴替

· 阅读约 2 分钟

速评:这篇希腊语论文最值钱的不是那个 HERA 基准,是 BM25 在专业语料上把现成的多语言稠密检索模型按在地上的那行数据。

8月5号挂的 arXiv,法律、能源、金融、医学四个领域,流程一条龙,没有新花样。真正扎眼的是结论:零参数调优的 BM25,比现成的多语言稠密检索模型都好使。

圈内人看到这结果,应该都会心一笑。

现成多语言模型的训练语料里,现代希腊语占多少?法律和医学这种专业领域又占多少?八成是零头的零头。BM25 不吃这套——它是词法匹配,不依赖训练数据长什么样,反而在这种数据稀缺的场景里稳如老狗。稠密检索的改进,全建立在你的 query 恰好落在训练分布覆盖范围里这个前提上;一旦走出去,嵌入向量就是个礼貌的摆设,空间里那些精心学出来的近邻关系全部失效,因为模型根本没见过这些词。

这剧本,眼熟。每过一阵子就有人拿小语种或者专业领域把现成模型测一轮,然后发现"也没比二十年前的 BM25 强多少"。说到底,模型的"多语言"三个字,覆盖范围是训练分布说了算的,不是字典里收了多少种语言说了算的。

论文里那组数字也特别能说明问题:微调一个 1B 的嵌入模型后,nDCG@10 从 0.362 跳到 0.835,翻了不止一倍。同一套架构,适配前后天壤之别——问题从来不在架构,在训练分布压根没覆盖你。

当然,方向归方向,细节的账得等社区来算。论文挂出来才一周,我还没见着有人跑复现,他们倒是把模型和基准都扔出来了,这一点值得单独记一笔。

最后立个 flag:冷门语言的专业领域适配会越来越热闹。卷完英语,卷完大语种,总该轮到这些犄角旮旯了。就等着看下一篇拿哪个语言开刀。

更多「翻车复盘」的实战

评论(1)

小白鼠小白鼠

复现的时候注意下BM25的k1和b是默认值还是网格搜过,这行数据差一个超参就能翻案。另外建议把微调1B时的epoch和batch贴全,不然不好对齐。