跳到主要内容
换嵌入模型,阈值别想直接搬:这篇论文把分数不可比这事拆开了

换嵌入模型,阈值别想直接搬:这篇论文把分数不可比这事拆开了

天平
天平

· 阅读约 8 分钟

这篇论文我读完第一反应是:终于有人把“换嵌入模型阈值要重调”这个破事当真测了一回。作者是 Rozmus 和 van der Putten,arXiv 2608.05857,已经被 Discovery Science 2026 接收。他们提出一个叫 Synthetic Query Probing 的方法,想用文档生成的查询构造受控配对集,然后学一个分数转换函数,把不同嵌入模型输出的相似度分数往同一个尺度上映射。三种映射方法——线性、等渗回归、分位数映射——他们对比了一通,结论我先给:分数不可比这事真实存在,不是幻觉;等渗回归在三个方法里最靠谱,这符合直觉;但论文里“部分对齐”这个说法太含糊了,含糊到我读完还是不知道阈值迁移到底能提多少。下面是我读完的拆法。

先把分数不可比的病根说清楚。嵌入模型输出向量,相似度是向量点积或余弦的结果。不同模型用的对比损失不一样、负样本策略不一样、维度不一样,所以分数分布天然不在一个量纲上。这带来的不只是“分数绝对大小不同”,而是分布形态本身会扭曲——同一个文本对,在模型 A 里可能压在 0.3–0.5 的窄带里,换到模型 B 就拉到 0.1–0.9。排序靠相对顺序,所以检索列表变化不大;但决定“这段要不要塞进 context”的阈值可就惨了,它是单模型专属的魔法数字,换模型就失效。这个病每个在生产上认真调过 RAG 的人都得过,只是以前没人把它当成一个值得系统测量的对象来治。

论文的方法不复杂,我直接说。拿一份文档,用 LLM 从内容生成可能的用户查询,再把这些查询和文本块配成对,得到一个有标签的配对集。然后你在这个配对集上,分别用模型 A 和 B 算分,拿 A 的分当输入、B 的分当目标,学一个转换函数。好处是绕开了人工标注,可以铺量,而且查询是文档生成的,天生和文档相关,省掉了“这个查询和文档到底匹不匹配”的判断成本。代价我等下说。

三种映射方法的差异,一张表能说清楚:

映射方法假设优点风险
线性映射分数差值是线性的简单、参数量少、可解释分布形态差异不是线性时拟合差
等渗回归只保持单调性,不预设形状灵活、能拟合单调非线性对噪声敏感,需要防过拟合
分位数映射按分位数重标定稳健、和分布形态无关只对齐分布、不顾及逐对关系

线性是最自然的起步,假设 A 的分数乘个系数加个截距就能换成 B 的分数。这个假设在分布形态接近时勉强成立,但真实世界里两个不同嵌入模型的分布形状,很少是简单的仿射变换。等渗回归保持单调性但不预设形状,能在不牺牲序关系的前提下拟合更复杂的非线性。分位数映射是拿每个分数在各自分布里的分位做重标定,保证目标分布形状对齐,但不对应任何逐对映射——两个完全不同的分数可能因为处在各自分布的同分位就被强行对齐,这在局部必然出岔子。

论文实验结论拆开看:排序大体一致,这个不意外,嵌入模型再不同,语义近邻的基本结构还在;绝对分数有系统性扭曲,这个也不新鲜,换过模型的人都知道阈值不可复用;有意思的是第三点——学到的映射确实能“部分对齐”相似度空间,提高阈值可移植性。问题就出在“部分”这两个字上。部分是多少?提高多少?在什么条件下提高、什么条件下不提高?这些论文里好像没展开。我看完实验表,只记得“有提升”,不记得提升了多少。这可能是我读得不细,也可能是论文自己就没说透。我倾向于后者。

等渗回归胜出这事我不意外。一个只要求单调性的非参数映射,在样本量够的情况下天然比线性更灵活,又不像分位数映射那样完全扔掉逐对信息。但等渗回归有个老毛病:拟合出来的函数是阶梯状的,对训练数据的噪声特别敏感,容易在阶梯里过拟合局部波动。论文里如果没加正则化或者平滑约束就展示等渗回归最好,我会觉得这个“最好”在更大的数据量或更复杂的分布下得打问号。这条我暂时不下死结论,等他们公开更多实现细节。

我最大的疑虑在 Synthetic Query Probing 那个 “Synthetic” 上。用 LLM 从文档生成查询,得到的查询分布和真实用户查询的分布能对上吗?真实用户问问题的方式经常是残缺的、模糊的、带错别字的、跨域跳跃的;LLM 生成的查询大概率是干净的、完整的、和原文措辞高度重叠的。如果学映射用的查询集偏离了真实生产环境,这个映射在真实流量下能泛化到哪去?论文用的是 SciFact 和一个专有语料库——SciFact 是科学声明验证类查询,陈述性、规范性,跟电商搜索或者客服系统里用户随手打的字差了不是一点半点。这条我只在“查询分布是否影响映射泛化”这个逻辑层面推了推,论文实验没有给更广泛的分布对比,所以我的判断在别的场景下不一定成立,等数据齐了我再更新。

阈值可移植性这个指标选得对。这比看分数直方图像不像有意义多了。你学的映射如果只是让两个模型的分数分布看起来差不多,但实际“相关/不相关”的判定阈值迁移准确率没提升,那就是花架子。论文肯把这个当评估指标之一,方向是对的。具体跨模型阈值迁移提升了多少,我这里不搬数字,建议自己去看论文里的实验表,把那几个数字放你自己数据集的查询分布下去理解。裸数字没有意义——这张表里每一个提升百分比都绑定了数据集、模型对、查询生成方式;换个条件结论可能完全不同。

论文被 DS 2026 收了,会开在美因茨,10 月上旬,arXiv 也挂出来了,DOI 10.48550/arXiv.2608.05857,cs.CL 领域。这说明同行审阅过了,方法的基本严谨性有人背书。但被接受不代表每个结论都能往生产里直接套——会议论文实验规模有限,那个“部分对齐”的“部分”在更大规模验证之前就是一个没有上界的承诺。这个结论是当前版本下的,下个版本如果作者公开更大规模实验的数据,会重跑——我盯着呢。

回到实际。如果你正在换嵌入模型的阵痛里,手里有文档、有检索系统、有个调好的阈值,值不值得上这套方法,按这个逻辑走:

如果你有足够多的真实查询日志而且有标注,直接做阈值校准最简单也最可靠,真实分布里学出来的阈值不需要映射兜转。如果你没有标注、但愿意接受“查询分布可能偏移”的风险,Synthetic Query Probing 加等渗回归学出来的映射可以做模型迁移时的分数对齐,至少比线性缩放靠谱一个量级。如果你连生成合成查询的 LLM API 成本都不想出,分位数映射当一次冷启动方案能给你个大概可用的初始阈值,之后靠生产反馈去调。如果你换模型之后发现排序本身已经变了——不是分数分布扭曲,而是近邻结构实质变化——那映射函数能救回来的是零。排序都不一致了,任何分数映射都是自欺欺人。

这篇论文的价值不在于给了能直接上线的工具——没代码开源,也没预训练映射函数;它的价值在于把“跨模型分数不可比”这个日常被当抱怨、却没被系统量化的问题,第一次拿到台面上用受控实验拆开。方法论意义大于工具意义:证明了合成查询构造正负样本可行,证明了等渗回归在这个任务上比简单线性有实质优势,也暴露了阈值可移植性的提升幅度并不大。约束摆在那里,怎么用是你自己的判断。如果你有内部数据和强大的查询日志,这套方法对你只是基线和下限,不是上限;如果你没数据,它是救急的梯子——踩着能过墙,但别指望梯子不抖。对照你自己的约束重新排,尺子在你手里。

天平
天平

一个品类拉 N 个方案上秤:维度对比表、benchmark、按场景给选型建议。

查看主页 →