跳到主要内容
一篇威胁检测论文,把我画的 RAG 图改了一笔

一篇威胁检测论文,把我画的 RAG 图改了一笔

画唠
画唠

· 阅读约 4 分钟

前几天在 arXiv 刷到一篇威胁检测的论文,八月中的,安全方向。本来手指已经划过去了,结果实验结论里有一行,直接推翻了我以前画的一张 RAG 的图。先撂这句:这篇东西最值钱的不是 F1 涨了多少,是它顺手证明了“RAG 是万灵药”这个说法——在强模型身上不成立。

先讲它在干嘛,很快。

内部威胁和 APT 检测这块,之前有人拿 LLM 直接对着日志做端到端分类——日志塞进去,标签出来。这篇的作者没走这条,他们把事情拆成了两段:第一阶段让模型读一个用户的时间线,输出的不是“是不是威胁”,是一堆结构化的、可解释的风险指标;第二阶段再把这些指标沿时间序列联合起来分类。

画张图:

  以前(端到端):
  原始日志 ──────────► 模型 ──► 有威胁 / 没威胁

  这篇(两阶段):
  原始日志 ──► 用户时间线 ──► 第一阶段:生成风险指标
                              ("这个人半夜下载了平时不碰的东西"这种)
                        │
                        ▼
                  第二阶段:跨时间步联合判断 ──► 结论

这个结构本身不算新,但用在这里很对味。APT 那种攻击从来不是“某一个时刻的动作可疑”,是散在好几个时间步里的动作拼起来才可疑。端到端等于逼模型一口气看完就交卷,两阶段等于先做笔记再答题。中间还塞了个 RAG,从用户自己的历史活动里检索个性化背景——“这个人平时就这样”和“这个人平时不这样”,检出率完全两码事。

好,铺垫完了。讲真正让我坐直的那部分。

我以前画 RAG 的图是这样的:查资料这一步让回答质量上升,检索越相关,结果越好。方向没错,但我默认它对谁都成立。这篇里有一组对照——同一个框架,开检索和不开检索各跑一遍——结论是:检索增强主要在帮弱模型。弱的开权重模型加上 RAG,能生成区分度更高的风险指标;强模型不开检索,成绩也差不多。

也就是说,我那张图得改:

  我以前画的:
  RAG ──► 查得更准 ──► 回答更好(对谁都一样)

  应该画的:
  RAG ──► 替模型补上它没有的背景知识
              ├─ 模型弱、缺这块知识 ──► 明显受益
              └─ 模型强、自己就懂个八九不离十 ──► 收益缩水

打个比方:RAG 像给考生递小抄。差生递小抄,成绩飞涨;学霸本来就会做,递不递小抄分数差不多,顶多答得快点。

等等等等,先别急着把这句比喻带走——这个比喻有个地方漏风,我得标出来。小抄是“有没有”的问题,而这里的检索内容是用户行为背景,属于“个性化”信息——理论上不管模型多强,它都不可能凭空知道“这个用户平时几点下班”。所以强模型不吃 RAG 增益,不是“它不需要背景”,更可能是“它已经能从当前时间线里把模式认得够准,背景带来的边际收益被压没了”。比喻说“学霸不需要小抄”,机制上其实是“学霸从题干里就能推出答案”。抓大方向用比喻,抠细节回到机制,这事儿我吃过亏。

这事儿为什么让我在意?因为现在到处都在讲“RAG 压幻觉、RAG 提效果”,讲得跟装水表一样,接上就好。这篇至少在一个具体任务上把边界量出来了:你手里如果是强模型,把功夫花在调检索上,可能不如花在别处。当然它是威胁检测这一个任务、两个数据集上的结果,我不敢保证推到别的任务还成立——但“RAG 的收益取决于模型缺不缺那块知识”这个框架,比“RAG 有用”这种正确的废话好用多了。

顺带一提,论文里还有个很诚实的发现:两个阶段分别用哪个模型,最优组合在不同数据集上不一样。作者也没硬造一个万能配置,就说了句“看数据”。这种态度比 F1 涨十几个点更让我信这个工作——数字是 CERT r5.2 上比之前的 GABM 高了 11 个点,PicoDomain 上高了 31 个点,涨得最凶的恰恰是那个更依赖跨时间步模式的 APT 数据集。这跟“先记笔记再答题”的设计是对得上的,不是瞎涨。

扯远了。拉回来。

我这篇真正想留给你的,就是那张改过的 RAG 图。下次有人跟你说“加个 RAG 效果就好了”,先问一句:你的模型弱在缺知识,还是弱在缺判断?前者 RAG 管用,后者 RAG 是白搭功夫——它顶多把知识喂到嘴边,咀嚼还是模型自己的事。

自检:你能不看着图,讲明白“为什么同一个 RAG,弱模型受益、强模型不受益”吗?讲卡住的地方告诉我,多半那里我也还没画明白,咱们一起补。

下期候选:lost in the middle 到底是注意力问题还是训练问题。想看就催我。

画唠
画唠

把被讲玄的概念用图 + 比喻 + 动手实验拆到咔哒扣明白,错的也保留。

查看主页 →