速评:这篇论文最该转的不是结论,是它自己招了在哪塌。
9月15号挂 arXiv 的 cs.AI 分类,9月16号出第二版,隔一天。14页正文配1张图。这个配置本身就有信息量——那些判断不是图跑出来的,是人一条条读答案读出来的。一天之内改了啥我没比对,不猜,可能是作者信息也可能是补表,不知道的事不编。
论文叫 AquiLLM,开放权重、离线部署的 RAG-LLM 平台,天文学做案例,帮科研团队存取隐性知识和正式知识。评估方式是领域专家上手评,不刷榜单。结论两句话:能从检索集合里找到依据的明确检索型问题,它最稳;需要综合信息、需要消解歧义的查询,faithfulness 就掉。
看完我停了一会儿。
这个结果该叫什么,论文自己的措辞是"前景与限制",客气。**这不叫限制,这叫卖点失效。**整套"用自然语言访问科学知识"的叙事,价值全压在后半句上——前半句那种"在档案里翻出三篇相关论文",天文学从档案库到 SQL 查询的流程干了二十年,不等着 LLM 来救。真正新的是拿大白话问一句"这几个观测季的数据对不上,是不是中间换过仪器",它替你把线索拼起来。而这正是它掉分的地方。
"保存隐性知识"这个说法也一样。隐性知识能不能进检索集合,取决于提问的人自己写不写得出来;写不出来就检索不到,检索不到就没有依据,没有依据就不叫 faithful。论文说的综合类查询,很多本质上是研究者自己都还没把问题问清楚的状态——模糊本来就是研究里的常态。拿这个状态去考一个要求"不出现无支撑主张"的系统,分低,很难说全是系统的锅。
数据隐私和对研究基础设施的控制权,论文列的两个动机,这个我信,也是真疼。但"离线跑、开放权重"回答的问题跟 faithfulness 是两码事。机构内部部署常挂一句"安全可控"——此安全是数据不出门的安全,不是答案不出错的安全。这两样在采购文档里常被写成同一句话,这篇论文把它们拆开了。拆开值得点赞,但我预计落地的时候会被重新黏回去。
挑刺也有。faithfulness 在他们这里的定义是三条:扎根于检索到的语境、不出现无支撑主张、不遗漏。第三条最狠,也最难量准。"没漏"这件事,尤其在需要综合的查询上,几乎等于要求评估者先知道完整答案长什么样——而专家也只在自己那一小块里知道。所以那批综合类问题上的低分,多少是系统真不行,多少是定义把自己逼到墙角,我打个折扣看。
还有个口径问题。研究者同时评估 RAG 当文档搜索接口、以及生成分析代码和流水线组件的可行性,可按同一个 faithfulness 定义,代码这块根本不进射程。文档搜索问的是"你说的是不是文献里写过的",代码问的是"跑起来对不对",后者不是"有没有无支撑主张"能衡量的。一个定义罩两种任务,其中一种明显撑不住。不致命,但足以让那张低分表多留一格解释空间。
方向我仍然信。检索类好做、综合类难做,这不是新剧本,剧本眼熟,只是换了个天文学的壳重演一遍。同一根曲线我见过太多轮:明确问、答得漂亮;换个问法、开始编。诚实的论文会把这半段写进摘要,不诚实的写进脚注。
唯一完全认同的是最后那条:作者主张在标准基准排行榜之外做领域专家评估。单拎出来像正确的废话,天文学给了它分量——红移、星等、观测季、仪器参数,那个领域里答案可核对,专家说对说错有硬标准,评估不是坐着凭感觉打分。同一句话换到一个没有 ground truth 的领域,就变成另一种东西了。这条我暂时没想清楚,不下结论。
这里立个 flag:接下来半年,这篇论文会被大量机构内部部署项目引成文献,被引的永远是"前景"那半句,"综合类查询掉分"那半句会被删掉。到时候回来收——万一方向又猜错,照例写一段认账。