跳到主要内容
七款开源模型答同一套题,最好的那款答对率不到一半

七款开源模型答同一套题,最好的那款答对率不到一半

阿简
阿简

· 阅读约 3 分钟

两周前挂上 arXiv 的一篇论文,标题长得没人愿意点开,讲的是开源模型在 ESG 报告里做检索问答。

本来我也差点滑过去。ESG 这三个字母离普通人远,论文里那些模型名,一半我都没听过。

但它里面有组数字,值得单独拎出来讲。

先说它测了什么。数据是欧盟上市公司 2010 到 2024 年的 498 份真实 ESG 报告,不是谁编出来的题目。然后让七款开源模型上去答,参数从 2B 到 30B。

检索这一环,几乎满分

上下文相关性 0.965 到 0.985,上下文精确率 0.78 到 0.81,召回 0.58 到 0.61。

简单说,该找的材料,基本都找到了。

再看生成那一侧。答案相关性 0.760 到 0.881,看着还行。忠诚度 0.607 到 0.822,勉强能看。

然后是最后一行:事实正确性,0.387 到 0.449。

七款模型,最好的那一款,答对率不到一半。

所有别的指标都在替这一行打掩护

我翻了几遍摘要,确认自己没看错。

那些 0.9 开头的数字,和那个 0.449,躺在同一份报告里。谁扫一眼摘要,记住的都是前面几个。

我甚至觉得,把这几个 0.9 摆在摘要最显眼的位置,是有害的。挑模型的时候大家看榜单、看 demo,真到要用的时候,你要的只有一件事:那个数字对不对。

三个单项第一,落在三款不同模型上

glm-4.7-flash 忠诚度 0.822 领先。qwen3 事实正确性 0.449 领先。ministral-3 答案相关性 0.881 领先。

放在别的地方,这种错位马上会被人做成一张选型表,配上"按需选择"四个字。

这里做不了。三个第一里成绩最好的那个,也不过半。选来选去,选的是一把都不够长的尺子。

结论作者自己写在摘要里了,但没人转

作者的判断是:需要针对领域做微调。

这句话我看一遍就记住了,因为在中文圈里几乎没人转它。也正常,它不好看。意思是模型不是选出来的,是调出来的。对只想找个现成工具的人来说,这不是个好消息。

换个角度,这反而可能是全文里唯一一句乐观的话。它说的不是这条路过不去,是现在刚走到门口。

这事离普通人没那么远

ESG 报告你大概不会碰,但这个流程你天天在用。换成你的合同、几份财报、几十条会议记录,形状是一样的:先检索,再生成,然后自己核对一遍。

这篇论文把钱花在最后那一步上,结果发现最后那一步最差。

有一段我没看懂

评估用的是 100 个人工合成的问答对,论文里的说法是"基于人物角色"。为什么要按人物角色来设计,这里我没吃透。

先放在这。等我搞明白了再回来补一句。

一句话搞懂 忠诚度

忠诚度,就是它讲出来的话里,有多少是材料里真有的。

  1. 材料里没有、它自己编出来的部分,会拉低忠诚度。
  2. 忠诚度高不代表答得对,只代表它没瞎编。
  3. 所以忠诚度和事实正确性要一起看。一个管"有没有胡说",一个管"说没说对"。

记住第三条就够了。

本周就这些。

上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。讲错的我补,没讲清的我改。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →