两周前挂上 arXiv 的一篇论文,标题长得没人愿意点开,讲的是开源模型在 ESG 报告里做检索问答。
本来我也差点滑过去。ESG 这三个字母离普通人远,论文里那些模型名,一半我都没听过。
但它里面有组数字,值得单独拎出来讲。
先说它测了什么。数据是欧盟上市公司 2010 到 2024 年的 498 份真实 ESG 报告,不是谁编出来的题目。然后让七款开源模型上去答,参数从 2B 到 30B。
检索这一环,几乎满分
上下文相关性 0.965 到 0.985,上下文精确率 0.78 到 0.81,召回 0.58 到 0.61。
简单说,该找的材料,基本都找到了。
再看生成那一侧。答案相关性 0.760 到 0.881,看着还行。忠诚度 0.607 到 0.822,勉强能看。
然后是最后一行:事实正确性,0.387 到 0.449。
七款模型,最好的那一款,答对率不到一半。
所有别的指标都在替这一行打掩护
我翻了几遍摘要,确认自己没看错。
那些 0.9 开头的数字,和那个 0.449,躺在同一份报告里。谁扫一眼摘要,记住的都是前面几个。
我甚至觉得,把这几个 0.9 摆在摘要最显眼的位置,是有害的。挑模型的时候大家看榜单、看 demo,真到要用的时候,你要的只有一件事:那个数字对不对。
三个单项第一,落在三款不同模型上
glm-4.7-flash 忠诚度 0.822 领先。qwen3 事实正确性 0.449 领先。ministral-3 答案相关性 0.881 领先。
放在别的地方,这种错位马上会被人做成一张选型表,配上"按需选择"四个字。
这里做不了。三个第一里成绩最好的那个,也不过半。选来选去,选的是一把都不够长的尺子。
结论作者自己写在摘要里了,但没人转
作者的判断是:需要针对领域做微调。
这句话我看一遍就记住了,因为在中文圈里几乎没人转它。也正常,它不好看。意思是模型不是选出来的,是调出来的。对只想找个现成工具的人来说,这不是个好消息。
换个角度,这反而可能是全文里唯一一句乐观的话。它说的不是这条路过不去,是现在刚走到门口。
这事离普通人没那么远
ESG 报告你大概不会碰,但这个流程你天天在用。换成你的合同、几份财报、几十条会议记录,形状是一样的:先检索,再生成,然后自己核对一遍。
这篇论文把钱花在最后那一步上,结果发现最后那一步最差。
有一段我没看懂
评估用的是 100 个人工合成的问答对,论文里的说法是"基于人物角色"。为什么要按人物角色来设计,这里我没吃透。
先放在这。等我搞明白了再回来补一句。
一句话搞懂 忠诚度
忠诚度,就是它讲出来的话里,有多少是材料里真有的。
- 材料里没有、它自己编出来的部分,会拉低忠诚度。
- 忠诚度高不代表答得对,只代表它没瞎编。
- 所以忠诚度和事实正确性要一起看。一个管"有没有胡说",一个管"说没说对"。
记住第三条就够了。
本周就这些。
上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。讲错的我补,没讲清的我改。
下周见。
