速评:8月4日,arXiv上挂出一篇叫SciRet的论文。四个作者,没发新模型、没刷榜,老老实实做了一遍实证研究——在2026年八月的AI圈里,这个操作本身就是新闻。
论文研究的是科学问答场景下的RAG流水线,数据集用的是CORD-19,三档语料规模,1K、5K、15K篇论文,看检索和重排序的表现怎么变。没有形容词,没有"颠覆",连标题都在副标题里规规矩矩写了四个字:compute-aware empirical study。
真正值钱的,是它怎么给自己下结论。论文明说了:评估用的标签是混合检索系统自己生成的伪相关标签,所以结果只能算"受控比较证据",不是基准性能声明。现在谁不是在发个模型就喊"最强""重构",它倒好,先把评估方法的底牌摊开,让你自己掂量着信。
伪相关标签确实不是什么漂亮东西——拿自己的输出去验证自己,循环论证的嫌疑洗不掉,论文自己也没装。可恰恰是这个"认了",让里面两个发现比多数刷榜数字更值得信:混合检索在所有语料规模下都比单一检索稳,1K和15K下Recall@10直接顶到1.000;另一个更扎心——经过MS MARCO训练的交叉编码器重排序器,换到科学语料上,反而把检索精度拉低了。
重排序那个结论,我得多说两句。领域不匹配的代价,能大过"更强交互"的理论收益——MS MARCO是搜索圈的标杆不假,可科学文献的长句、术语、行文逻辑和网页搜索根本不是一回事。前两年圈里流行一个词叫"通用重排序器",好像预训练语料够大就能通吃所有领域,这篇论文专挑了科学RAG这一块地说:开箱即用?不存在的。它没说重排序不行,只说领域不匹配是个真实的坑——这个分寸,比一竿子打死高明。
"通用"这个词,在重排序器这个行当里,该降调了。
代码、索引、评估输出都开源了,查账的门开着——这个动作比正文更像一个敢让人来对质的作者。
这里立个flag:我赌未来半年内,另一组人会在不同科学语料库上复现出趋势相近的结果,到时候"通用重排序器"这个叙事该改口了。如果没人复现,也行,我回来认账。
