arXiv 上一篇合规自动化的论文(2608.02472,Roman 他们三个,四大之一内部做的 POC)最近在我时间线上晃了好几回。转的人都拿它当“AI 替代合规审查”的新闻在转。我看了一圈,没人讲它内部是怎么转的。行,那我干我常干的事:当黑箱,画开。
一句话交代它是什么:CTRAG 就是一条 RAG 流水线,两头很特别——一头喂监管文本,从里面抽出“控制问题”;另一头是公司自己的非结构化文档,中间做交叉比对。
画张图:
监管文本 ──► 抽出控制问题("数据必须加密存储吗?")
│
▼
检索公司文档 ──► 比对 ──► 合规 / 不合规 / 查不到
▲
公司文档(政策、合同、云服务说明……)
就这个结构。不性感吧?但有个细节我盯着看了半天:他们专门处理了“间接合规”——你的合规性不写在你自己的文档里,而是藏在第三方云服务的条款里。“查资料”这一步得跨出公司文档的边界去够别处的东西。手动干这个又慢又不一致,这正是论文要捅的那块最疼的地方。
打个比方,然后我马上拆自己的台
打个比方:CTRAG 像一台“考试出题机 + 阅卷机”。监管文本出题,公司文档答题,模型判卷。
这比喻漏风漏得厉害,我得老实标出来。人判卷是“读懂了再判”,模型判卷是“检索回来什么、拼进 prompt 什么、它觉得相关不相关”。上一格“判断”没做好,题出得再好也白搭。我之前画 RAG 那张图就漏过这一笔,这次先给自己补上:
控制问题 ──► 检索 ──► 判断"这段相关吗/够吗" ──► 用上/丢掉 ──► 结论
↑ 真正的胜负手在这一格
论文自己也认这一格。它那几招——自适应分块、动态检索配置、上下文学习——全是在喂“判断”。F1 78%、召回 85%,单看不惊艳,但这是拿真实案例跑出来、跟人工合规报告交叉核对过的。85% 的召回什么意思?人工审一遍的活,它先筛掉一大半,剩下的留给人。不是替代,是先过一遍筛子。
我忍不住动手试了一下
光看论文不过瘾。我想验证的不是它的数字,是那一格“判断”到底有多脆。
土办法:拿一段互相矛盾的材料喂给一个类似的检索比对流程——一段说“数据由云提供商加密”,另一段说“加密责任在客户”。我想看它是各打五十大板,还是挑一段装没看见。
结果挺有意思。两段都被检索回来、都进了 context 时,它会给“存在冲突,需人工确认”这种还算体面的回答;可一旦分块把第二段切得只剩半句,它就顺着半句一路判下去,判得理直气壮。
我盯着那个输出看了半天,脑内只有羊叫。然后——等等等等,先别急——咔哒一下扣上了:这恰恰解释了为什么 CTRAG 要在“自适应分块”上花那么大力气。分块不是预处理杂活,分块直接决定矛盾会不会被切散。我第一版以为分块就是个工程细节,动手挨了一次打才明白:在合规这种场景里,半句话被切掉,结论能从“不合规”翻成“合规”。一个切分策略背后压着的是对错的判定,这玩意儿真的太酷了。
(说明一下:我这个实验跟人家的系统差得远,别拿我这次翻车去质疑论文的数字——我是想看脆在哪,不是想复现。)
被讲玄的部分,其实是个老问题
转发里很多人把这套东西讲成“AI 学会合规了”。没这回事。拆开看就是:出题(规则结构化)+ 查资料(RAG)+ 判卷(LLM 判断),三个都是旧零件。新东西在于把它们对准了“间接合规”这个手动做最疼的场景。疼在哪?疼在你得去读云提供商那几百页条款,还得跟自己公司的政策一条条对上。人干这个会累、会漏、会今天严明天松。
所以我对那类“AI 取代合规岗”的转述式标题没啥好感。78% 的 F1 已经讲得很清楚:它是筛子,不是法官。筛子的价值在于让人的注意力只花在剩下那 22% 的疑难上——这个价值本身够大了,不需要吹成别的样子。
跑个题。我有个念头开了头一直没收尾:控制问题本身是怎么抽的?监管文本到“问题”那一步也是个 LLM 活儿,抽偏了后面全歪。论文这块我还没完全画明白,先放在这里,懂了再补。扯远了,但其实和“判断”那格是一回事……算了,先拉回来。
照例留个自检:你能不能给同行讲明白,CTRAG 的胜负手为什么不在“检索”、在“判断”那一格?讲不明白的话,多半是我这张图还没画够——告诉我,我补。
下期想画开哪个?我候选清单上躺着 KV cache 好几周了。
