先说结论:上个月挂上 arXiv 的这篇 EA-Graph(2608.04278),是我今年读过最克制的 agent 记忆论文,克制到不像这个赛道的产物。
我是带着找茬的心情点开的。这半年 agent 记忆方向的稿子看得太多,十个里九个半在画饼。预期拉满,结果被往好的方向打了个脸。
先说它要解决的问题。动机很朴素:agent 跑完会话留下的散文式笔记,往往只存了结论,存不下支撑结论的程序状态。上游一改,仓库照样能构建,旧的验证声明早就悄悄烂了,笔记里还写着「测试全绿」。
这点我太有共鸣了。我自己项目里的 agent 备忘就是这么个东西,跑完留一句「没问题」。至于当时凭什么没问题,鬼知道。依赖一升级,那句「没问题」就是定时炸弹。
扯远了。说回论文。
EA-Graph 的做法是把声明锚到工件上。子路径粒度,别名解析到叶级定义,每条验证声明挂回它当初依赖的实际内容。证据强度和新鲜度分开算。最关键的一条:替代内容拿不到时,声明直接标「无法证明」,不许猜。
不许猜!就这三个字,值得单独起一段。
实验也不糊弄。生成仓库,行为和工件的对应关系已知,让模型把既有声明分三类:未受影响、受影响、无法证明。漂移分数值和逻辑两种喂,再加一手故意扣留上游内容。
「Haiku 层级上,锚定记忆在全部 7 个世界优于散文笔记和无记忆」,论文的说法大意如此。数据摆出来:
会话数: 42
干净世界: 7
模型世界实例: 14
记忆条件: 3
模型层级: 2
Wilcoxon 精确配对 p = 0.0156(7/7 个世界)
样本就这么大,7 个世界全胜还个个过检验,这在同类论文里已经算硬的了。
真正让我坐直的是下一处。Sonnet 层级,锚定条件拿到满分,但对照组也集体顶到天花板,预注册对比没过显著性。论文白纸黑字写:未达统计显著性。
换一份通稿,这句会变成什么?「全面碾压,性能登顶」!🙃
它没有。它写的是对照组触及上限、对比不成立。这一句,比多少页 benchmark 截图加起来都有说服力。
还有更绝的。上游内容被故意扣留之后,42 个会话,没有一个捏造被扣的内容。一个都没有。我手头的 agent 可没这么老实,上下文一缺就开始即兴创作,编得比真的还流畅。
结论部分照样收着写:只在测试环境中改善了较小模型的不可证明性判断。效率?没主张。修复质量?没主张。换成别的团队,这机制早被包装成「自动修复上游漂移,节省 87% 排查时间」了,数字随口编的,反正通稿从来不用对数字负责。
中间还有条探索性结果:结构化声明记忆可能通过外化会话内的重新推导,缩小大小模型的能力差距。论文自己跟了半句:不确立跨模型等价性。
要换成发布会 PPT,标题已经拟好了:《小模型平替完成,成本直降九成》。人家偏不。😅
丑话也得说,不然这篇就成了单口相声。
生成仓库不是真实项目。行为与工件对应关系已知,真实仓库哪有这么干净,真实的上游漂移也不止数值和逻辑两种死法。所以这些数据我照单全收了吗?没有。我还没复现,一个数都没亲手跑过。按我自己的规矩,没复现的数据一律先挂「待验证主张」,这篇不例外。你现在看到的所有夸奖,夸的是它的诚实,不是它的结论。
这条先立在这,回头扒到代码再说第二遍。
不过这套东西当照妖镜是真好使。拿它去照市面上那些「跨会话记忆」的宣传,就问两句:你记忆里哪条声明是锚在具体工件上的?上游变了之后,它敢不敢自动标「无法证明」?
一问一个不吱声!😄
大多数所谓记忆功能,存的是会话摘要,把 agent 自己说过的话再嚼一遍。摘要不会告诉你它过时了,它只会理直气壮地继续骗你。
锐评评分卡:机制是真的有新意,数据没注水,结论守得住边界,这三样在 2026 年的 agent 论文里凑齐,本身就够算个事件。这半小时花得冤不冤?不冤。但别指望读完就能拿去修自己的项目,它没主张这个,你也别替它主张。搞 agent 记忆的,去读。写通稿的,更该去读,重点学人家怎么写「我们没主张什么」。
下次再看到哪家吹「跨会话智能记忆」,我就把这篇甩过去。对照着读,谁在裸泳一目了然。