跳到主要内容
本周小抄:让模型自己决定去翻哪里

本周小抄:让模型自己决定去翻哪里

阿简
阿简

· 阅读约 5 分钟

为什么一篇讲专利检索的论文,值得放进本期小抄。

因为它把 RAG 里一直由人来干的那一步,交给了模型自己。

这篇 8 月 11 日挂上 arXiv,编号 2608.11030,主分类 cs.IR,交叉列了 cs.CL。九个作者,第一作者 Jian Zhang。同时也被 IEEE CSCWD 2026 接收了。

上个月的东西,不算新鲜。但它把一件我憋了很久没说利索的话,写成了一个具体做法。

专利检索这个场景,挑得挺准

专利文档不好读。结构复杂,术语密集,还夹着图。两件专利差在哪,很多时候就差在一个词的限定范围上。传统方法看不出这种差别。

拿 LLM 做这件事,现在主流是两条路。

一条是给模型灌领域知识。领域预训练,或者指令微调。要人工标数据,训完还容易把原来会的东西忘掉。论文里管这叫灾难性遗忘。

这个理由被用滥了,模板里人人写。但标注成本是真金白银,这是实话。还有一条论文没怎么强调:权重里改东西慢。分类体系是会变的,外挂的库改起来快,权重改起来慢。

另一条是标准的 RAG。外挂一个库,检索回来的内容喂给模型。论文认为这条路的问题是,模型自己解析专利、挖深层语义的那部分能力,没用上。

这个批评挺准。

画框这一步,以前一直是人在干

RAG 里最容易被忽略的一步,是"检索什么"由谁定。

切片是人切的。embedding 是人选的。召回几条是人调的。模型只是在人画好的框里挑。

专利这种文本,人预切一刀很难切对。结构一复杂,先切碎再拼回去,信息就丢了。

论文的做法是把画框这一步挪给模型。让它自己从查询里抽关键技术实体,搭一个层级化的本体结构。再用这个结构去做查询扩展和精准检索。检索那一层是 FAISS,配一个生成式的匹配机制。

FAISS 不新。生成式匹配也不新。这堆东西拼起来,创新点全集中在前面那一步。

"自知识"这个前缀,起得有点玄

框架叫 Self-Knowledge Retrieval Augmented Generation。

这个"自知识",不是说模型知道自己知道什么,也不是它会自省。

它指的是模型自己抽出来的那批实体。这批实体构成了下一步检索的知识基础。

名字玄,机制直白。

提这个是想说,看到"自知识""自反思""自进化"这类前缀,先别急着觉得它跨了一代。多半只是把一步本来就有的操作,换了个主语。

真正被挪动的是归属权

RAG 火起来这几年,大部分改进都堆在"检索完怎么用"那一侧。重排、压缩、融合、再加一层 rerank。这些都有用,但都没回答最开始那个问题:该去翻哪几页。

效果那几个点,论文说提升明显,在真实专利数据集上跑的。我不复述,也没法替你验证。数据集够不够真、指标挑没挑,得你自己去看。

我想收的是另外一件事。把画框交给模型之后,上下文就不再是"你给什么它读什么"。它先画一张地图,再按地图去翻。

专利是块合适的试验田。文本难,判断细,人对"该抽哪些实体"本来就没把握。换成法律文书、内部工单、医疗记录,逻辑是一样的。

这对普通人意味着什么

你大概率不做专利检索。这条对你有用的地方不在这儿。

你会在别处碰到同一件事。Cursor 读你的项目,Claude Code 翻你的目录,它们怎么决定该看哪几个文件。现在这一层靠规则,靠文件名匹配,或者靠你手动 @。

再往前走一步,就是它先给你的项目建个结构,自己决定去哪儿找。

留意一下这些工具最近的设置页。关键词在变。以前那一栏问的是"塞多少上下文"。以后多半会多出一栏,问你要不要先建索引、先跑一遍解析。

这个变化不显眼。但它决定了你以后是手动喂它,还是让它自己去够。

一条我没看懂的,先放着

层级本体那部分,我只懂一半。

它怎么维护,专利更新了要不要重建,抽出来的实体要不要人工过一遍。这些我读得糊。

可这一步决定了它能不能真用起来。抽出来的本体要是错的,后面检索得再准,也是在错的路上准。

论文里提了专利含多模态信息,但框架里拿图怎么办,我没找到清楚的一段。一并放着。

先搁这儿。搞明白了再补。

顺带说一句,九个作者的活,看着不像小工程。真落地要多少工作量,比论文里写的多。

最后

题外一句。翻 8 月 cs.IR 新提交的时候,这类"给 RAG 前面加一步"的论文我见过不止一篇。这篇能被会议收下,大概是场景选得实。专利检索有真需求,有公开数据,评起来有标准。换个场景,很多就悬了。

本周就这些。

上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。讲错的我补,没讲清的我改。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →