跳到主要内容

图记忆照妖镜:输给最土的向量检索 5 个点,赢的反而是「遗忘」

毒角兽
毒角兽

· 阅读约 4 分钟

先说结论:arXiv 上周挂出来的那篇图结构 agent 记忆论文(2608.28978,cs.AI),主战成绩是图方法 token F1 0.417,扁平向量检索基线 0.468。输五个点,显著地输。而全文最值钱的数据,跟图本身一毛钱关系没有。

这组数字要是出现在厂商通稿里,早被编辑掐了。出现在论文里,白纸黑字。

背景只补半句。现在一聊 agent 长期记忆,叙事高度统一:向量检索太浅,得上知识图谱。发布会这么讲,融资 BP 连架构图都替你画好了 📈。仿佛不做图谱,agent 就不配拥有过去。

我上回信「更聪明的记忆」这种话术,还是被某家的年费套餐教育的。具体哪家不点了。所以这回我拿这篇论文当照妖镜,照一照「图谱记忆」这届叙事。

叙事说图强,论文实测说:

graph method token F1:   0.417
flat vector baseline:    0.468
paired bootstrap diff:   -0.050
95% CI:                  [-0.085, -0.016]

固定五个检索根节点的预算,五百个问题的配对 bootstrap。置信区间整个躺在零以下!这不是噪声,是被打明白了。

更难看的在拆项里。回忆「助手之前说过什么原话」这类问题,人工判定正确率 0.911 掉到 0.607。三十个点没了!

论文自己给了猜测:把对话轮次抽成带类型的节点、带属性的边,抽得太碎,原话那口气散了。问题要的是那句话的表面形式,图里只剩一堆实体在开茶话会。两跳子图绕来绕去,绕不回原文。

向量检索那个土办法反而占便宜。原文切片,原样存,原样捞。土,但答案就躺在库房里,没被拆散分装进一堆抽屉。

写到这我本来准备收工开怼。往下翻,剧情拐弯了。

全文真正硬的,是那个选择性遗忘模块。定期给节点打分,新近度、访问频率、度中心性、年龄加权组合,低分出局。直觉上这玩意儿必掉分。我预期拉满。

然后被打脸。这次是往好的方向打脸。

graph size:            27021 nodes
one forgetting pass:
  nodes removed:       9.8%
  bytes removed:       9.5%
  token F1 change:     +0.001, 95% CI [-0.015, +0.016]

删掉近一成节点、近一成存储,F1 纹丝不动。人工判定正确率降 1.6 个点,区间 [-0.038, +0.006],最大损失被摁死在 3.8 个点以内!

这是全文我最认的一段。不因为好看,因为人家把「最坏亏多少」一起交代了。市面上九成记忆框架的宣传只说「我们的记忆更聪明」,从不提删旧数据要付多少利息。账单上那部分才是真的。

照例给自己泼冷水:这个遗忘结果我只认 LongMemEval 上的表现。换我的脏乱老项目喂进去行不行,没测,先别跟着我兴奋。代码倒是放了,回头我自己跑一遍再补嘴。

作者在限制那节也算老实:抽取器就一个小模型,基准就一个,结论只覆盖这条抽取式流水线,推不出「图记忆这个物种不行」。这个分寸给好评。换通稿的手来写,标题早就是「记忆新范式」了,0.417 那个数你一辈子看不到!

所以这篇东西的正确用法,两条。

一,下次谁拿「图谱记忆」当卖点向你推销,把 0.417 对 0.468 那行拍过去。不是证明图谱不行,是证明「图谱」俩字本身不构成卖点,拆成什么样的流水线才算数。叙事归叙事,账归账。

二,「遗忘不伤性能」这个结果比主实验更值得抄。存储和节点维护是每个月都在付的成本,掉的分有置信区间兜底。这个账,比订阅页上任何百分比都实在。

锐评评分卡:图结构主战,不及格,这波输得不冤;诚实度,满分,敢把输的结果原样发出来,就赢过九成通稿;遗忘模块,真金,思路直接抄。这钱花得冤不冤?冲着遗忘模块去读,不冤;冲着「图谱」这个词去跟风,真冤。至于把图谱记忆写成下一代基座的那批文案,照旧——科幻小说体裁,留着融食用。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →