8 月 26 号挂到 arXiv 上的这篇 PlanSightRAG,我看了两遍。第二遍是因为第一遍读太快,差点被那个 100% 的准确率骗过去。
先把值得夸的说清楚。这论文干的事,是把建筑标准图纸直接当图像来索引和推理——不走 OCR 转文本那条老路。做法本身不是没人提过,但大多数标着"多模态"的工程文档系统,实际干的事还是:先 OCR 把图转成文字,再把文字喂给模型。图纸上的几何关系、布局信息、尺寸标注的上下文,往往在这一步就丢了大半。PlanSightRAG 直接对图纸图像本身下手,保留了视觉信息再去做检索和推理——这一步,方向是对的。"视觉优先"这四个字,不是通稿里拿来撑门面的形容词,是真改了流水线的架构。
数据也做得比一般的预印本扎实。基准数据集不是自己画的几张样图,是实打实从五个州的交通部收集来的标准图纸,4056 对样本、1898 页。零样本条件下 Recall@5 到 91.47%,另拿一个密歇根交通部的独立语料库去测——也就是说跟训练集完全分开的数据——也能有 91.40%。这类数字最怕的是只在自家后花园里开花,他们至少把花挪到别人院子里试了试,还种活了。
32 页、25 张表,投的是 Automation in Construction。论体量和实验完整度,这篇预印本比这个圈子里大量灌水的"照片描述 + 简历筛选"多模态论文要狠得多——人家是真把工程领域的脏活累活干了一遍的。
但读者要是看到那个 100% 的判定准确率就直接转发"AI 合规审查已死",那我劝你先把第 7 条实验设置读三遍。那 100% 是有前提条件的:预先给定已解析的规则阈值。说得直白点,规则是别人解析好、喂到嘴边了,模型拿着这个阈值去做判定。这事儿的难度,跟自己去读规范原文、自己理解什么数值该匹配什么条款,差着好几个量级。
论文掐在监管安全这条线上打了个擦边,让领域里相关人士直呼"这方向必须做"。合规审查的吸引力确实大。但我不信工程界会愿意把关键规则的可解析步骤——也就是链条里最难、最不该出错的那环——双手交给模型自己去悟。不信归不信,这套框架的价值是不打折的:它把从前纯靠人工翻图纸的合规初筛,变成了人工兜底审查前的自动过滤网。要知道同行论文多的是在合成图上自己画自己测,能在真实州政府语料里跑出 91% 零样本检索的,今年我还没见着第二家。
有个念头开了个头,先不展开:如果真按论文说的,不用人喂规则、直接让模型从规范语料库自主提取数值限制就能实现"自主视觉规则锚定",那为什么那张 100% 的表还是要在"已给阈值"的前提下才能跑出来?这个落差,我盯着。
所以这里立个 flag:这篇论文的下一版、或者 follow-up 工作,一定会公布"去掉人工解析规则、完全自主提取阈值"之后的判定准确率。到时候如果数字还是 100%,我把我这篇收回去,承认这才是真让规则解析也自动化了。如果掉了,哪怕只掉到九十几,那说明那 100% 的水分,比我今天闻到的大。 届时回见。
