先说结论:这篇 8 月 18 日挂上 arXiv 的 CoAL-RAG,方向选对了,数字有点飘。
法律问答的老问题:用户提问的复杂度方差极大。「劳动合同到期不续签有补偿吗」和一坨纠缠三方主体的合同纠纷,喂同一套检索管线,前者浪费 token,后者检索一塌糊涂。单一策略两头不讨好。这话论文里说得没错,做过垂域 RAG 的都踩过。
CoAL-RAG 的解法:把「选哪种检索策略」本身做成自适应。拆开两步。第一步,按问题的逻辑结构量化推理需求。第二步,拿语义检索和关键词检索的结果差异反推复杂度——两个检索器意见越不一致,问题越拧巴。然后按这个信号选策略、动态过滤上下文。
第二步这招我服。
不训「复杂度分类器」,直接拿两个现成检索器的分歧当免费探针。省事、可解释、不用标数据。我之前一直觉得复杂度判断要么人拍脑袋分档,要么训模型,检索一致性当代理信号是我没想过的角度。预期拉满结果被打脸,这次是往好的方向打脸。
然后是数字环节,掏照妖镜。
摘要里最亮眼的两个:中文数据集上 BLEU 比知识图谱基线提升 42.5%,ROUGE-L 是对方 3.6 倍。
先看 3.6 倍。
ROUGE-L 翻三倍半,在法律 QA 这种输出高度模板化的任务上,只有两种可能:要么基线烂得出奇,要么输出在背法条!法言法语本身就重合度高,一个逐句引条文的系统和一个转述的系统,ROUGE 分差可以大到荒谬——但这不代表用户拿到的答案好 3.6 倍。法律咨询的生死线在引用准不准、推理链断没断,ROUGE 一个都量不出来。
再说 42.5%。
「较基于知识图谱的方法提升」——KG-based 基线在中文法律 RAG 里什么水平,做过的心里都有数。建图贵、维护更贵、召回还经常莫名其妙。拿它垫底,赢面本来就大。跑步比赛挑了个腿受伤的对手,赢了是真的,含金量自己掂量。
这套对比是论文圈常见操作,不算这家独创的毛病,我就不骂了。但判断不变:这两个数字撑不起「显著优于」四个字,撑得起的是后面那条。
后面那条是跨法域。
LexGLUE 和 CaseHold 是英文基准,法域、语言、条文体系全换了。一个在中文法律数据上调理出来的自适应策略,换到英美法数据还能保持生成质量、深层推理和效率的平衡——这要是复现得出来,说明它抓到的「复杂度信号」不是中文语料的巧合,是有点普适性的东西。这比 3.6 倍 ROUGE 值钱多了。
注意我说的是「这要是」。
摘要级别的「保持了高精度」,我的默认处理是当科幻小说看,等代码和 prompt 放出来自己跑。复杂度感知这套机制里有个我不放心的点:语义检索和关键词检索的「差异」,在法条这种天然充斥固定术语的文本上,会不会系统性偏大?「合同解除」和「解除劳动合同」,BM25 和向量检索的意见能差出十万八千里,但这俩问题复杂度根本不在一个量级。探针在这个域会不会失灵,论文不放消融数据我不信。这条我还没验证,先别全信我这半句——但你也先别全信他们的。
还有个更基本的问题,论文没提,我替它提了:自适应选策略,意味着简单问题走轻量路线省下的开销,得先付一份「评估一遍复杂度」的税。这税多重、简单问题占比多大才回本,摘要里一个字没有。「效率」要是只算检索侧不算评估侧,这个平衡就有点自欺欺人了。
锐评评分卡:方向值得跟,自适应检索在垂域 RAG 里是真实需求,拿检索分歧当复杂度探针是这波最聪明的一手。宣传数字自动打三折——ROUGE 3.6 倍在法律文本上约等于没说,KG 基线是软柿子。这论文值不值得现在跟?值得,跟方法框架,别跟对比表。等代码开源,我拿手里那个跑不动的法律语料再照一遍,到时候数字说话。
