跳到主要内容

图 RAG 那个监督缺口,补完之后挪了个位置

嘴替
嘴替

· 阅读约 4 分钟

速评:8 月 25 号挂上 arXiv 的一篇图 RAG 论文,代码要发邮件找作者要。

这不算槽点。评审期的 v1 不挂仓库,是这个领域的常态,拿这个开炮属于找错靶子。但这条得先记着,它决定了后面所有"比基线好"的句子该用什么姿势读。

论文叫 SelfGraphRAG,标题里那句 bridging the supervision gap 已经把要讲的事摆在脸上了。图检索要训一个以查询为条件的检索器,训检索器要标注问答对,而刚建出来、还没进过标注流程的图谱正好没这玩意儿,死循环。作者的办法是从图结构里往回生成问答对,多跳路径和局部邻域都拿来出题,拿这批自产的题去训检索器。多跳问答和分类两套 benchmark 上跑,检索精度和下游推理都压过基于嵌入的基线。

先看这张纸的规格。16 页,2 张图,注明脱胎于硕士论文,还在评审。2 张图这个数字挺说明问题,论证的密度在正文里,不在可视化上。ACM 分类挂了四个,信息检索、知识表示、学习、自然语言处理各占一格——一份投稿想被四个圈子认领,这个信号比摘要诚实。

我的判断是,那个所谓被补上的缺口,只是挪了个位置。

自监督走不出这个圈:出题的依据和受考的对象,是同一份结构。

图谱不是天上掉下来的。谁抽的实体、谁划的关系类型、什么算一条边,全是上游那条抽取管线的决定。你从这个结构里出题,再用这批题去训检索器,训出来的东西最擅长的事必然是沿着这张图自己认账的那些连接往下走。而沿着边往下走,本来就不是图检索里最难的部分。自己出卷自己考,分数当然好看。

真正难缠的错不长这样。是那条边本就不该存在,是提问的人要的那条关系压根没人抽出来。这两类错在自产问答里几乎不会出现,因为出题的起点就是现成的边、现成的邻域。模型学会的是照结构找路,不是判断这条路该不该在。

要说这招没用,那是抬杠。没有标注的时候,自产的监督总比裸奔强,这是常识,不值得当新闻讲。合成数据这一路本来就这么被抬起来的,先解决有没有,再解决对不对,指令微调当年也是从这条泥路上走的。这里我得承认自己有个前后不一致:上个月我还在念叨合成数据把训练管线泡软了,今天又在说它是必经之路。人是矛盾的,评论员也是,两句话我都不撤——它们说的是同一件事的两面,绕过标注是唯一走得通的起步姿势,同时也是天花板所在。

我更在意的是这篇东西出去以后会被念成什么。16 页里那句"标注不可用时图结构可以提供有效监督",大概率会被掰成"图 RAG 不用标注数据了"传出去。这话论文没说过。论文说的是:在两套 benchmark 上、比嵌入基线好。中间那段距离——从"比基线好"到"不需要标注"——够塞进一整个产品的宣传页还有富余。

至于代码要发邮件拿,我理解。审稿阶段,署名的还是两位作者中的一位,不搞公开仓库是常规操作。但这里有个副作用得点出来:这篇论文的全部贡献就是那条合成数据管线,管线看不见,外部能核的只剩表格里的数字。题出得够不够散、会不会全堆在几个高度数节点上、换个抽取质量差一档的图谱还成不成立——这几件事都不在表格里,在代码里,而代码在收件箱里。这不是道德问题,是读这类稿子本来就该打的折扣。

所以这里立个 flag:年底之前,"GraphRAG 免标注"会被当成一句结论来引用,而且用的人八成没跑过它。真有人拿一张自己抽得乱七八糟的图谱去复现,会发现自监督给出的那点信号,上限就是那张图谱的抽取质量,一分不多。到那天再回头看这版 v1,会发现它其实把前提写得挺规矩——前提是被转述的人剪掉的。

论文把话说得清清楚楚,剪前提的是中间那一环。这笔账,记在谁头上?