跳到主要内容
Foundation Model 这四个字,又被拿来当帽子了

Foundation Model 这四个字,又被拿来当帽子了

嘴替
嘴替

· 阅读约 4 分钟

速评:这篇论文标题里最撑不住的,恰好就是 WFM 这四个字母。

9 月 16 日挂上去的,arXiv:2609.18182,分类只挂了个 cs.AI,十二个署名作者。到今天三天整,DOI 那栏还挂着待注册。三天,连身份编号都没走完流程,离技术结论就更谈不上。

先看摘要那层。一边是一套叫 Wiki Graph 的 schema,把稀疏图的显式拓扑跟密集文本的连续语义缝在一块,配了个查询条件化的注意力聚合;另一边是分布式集群上的 NCCL 边界交换协议,用固定形状的 GPU 到 GPU 集合通信绕开 CPU 序列化和内存拷贝,报了个 10.5 倍训练加速。

后一条才是这次的主角。前一条是包装。

论文自己交代得很清楚:业界已经在往 LLM Wiki 那条路上走了,一堆 markdown 文档加多层拓扑链接,agent 拿它当非参数记忆。注意这顺序——做法是工程师先趟出来的,论文干的是回头给这股已经发生的惯例补名字、补 schema、补一张 benchmark 表。这个链路本身不丢人,学术圈给工程惯例补形式化,本来就是正经活。丢人的在名字。

Foundation Model 这个词现在什么行情,圈里人都清楚。它背后压着预训练,压着 scale,压着一堆任务上的通用表现。这篇从头到尾谈的是表示和检索,是给 agent 配长期记忆的底座。它撑死算 foundation 的基建,不是 foundation model。给一层检索中间件挂这块牌子,就是拿形容词顶班。

10.5 倍那个数,也得掰开看。相对谁,摘要那层没交代,只说在分布式集群上。这种数字传播命特别好,因为它不需要上下文就能被压成一句标题;可它也最难被外人独立验证——你得有那个规模的集群、那个网络拓扑,才能对得上号。十二个人署名,不像两三个人的小作业,更像某条线在正式对外之前,先来 arXiv 占个位置。

顺带扫一眼分类页,cs.IR 和 cs.DC 都不见,只有 cs.AI。是有意选的还是懒得选,我不知道,反正挺有意思。

名字负责被引用,方法负责被使用,这两半各干各的,别混着看。

要替它说句公道话也不难。稀疏图表示编码密集文本这件事,本来就别扭:图上那套节点边关系,处理段落级的连续语义是笨的;反过来,拿现成的图编码器去啃一堆 markdown 文档,工程上会炸出一地分布式调度问题。论文里提到部署开销会拖住规模化落地——这不是话术,是行内人一眼认得出来的真痛点。出发点站得住。schema 和那几个正则项要是做扎实了,是能被后来的人直接拿去用的东西,不在乎它头上顶着什么名号。学术史上名字起得比内容大的论文多了去了。

现在说我不看好的那部分。五个 benchmark,长期记忆加多跳推理。这两个方向是 agent 记忆类论文的自留地,选得没毛病,但也说明不了什么。这类榜单保质期有多短,我说过不止一遍。今天离 v1 上线才第三天,社区连复现的力气都还没花,数字先记着,别先转。这回还多一层麻烦:论文的主要卖点之一是训练和推理侧的基础设施效率,那压根不是别人拿张卡跑个脚本就能对上的指标,得有人在同等规模的集群上重做一遍,才谈得上验证。

说到这我得承认自己有点分裂。上个月我还在抱怨,做 agent 记忆的论文里愿意认真处理表示层的没几个,大多在堆 prompt 技巧糊过去。这个月人家认认真真把 schema 和注意力聚合端出来了,我坐这儿挑人家名字起得大——这不叫客观,这叫职业病。人是矛盾的,评论员也是,这条我不装。

这里立个 flag:WFM 这个词三年后要是还活着,让它活下来的不会是这篇论文,而是某个做 agent 记忆的团队在自己文档里顺手用过一次。学术名词的寿命,一半靠论文,一半靠别人的 README。

10.5 倍那个数,两周之内我不指望看到有人往外复现。猜错了,我回来收。