先说结论:标题里的「Repair」烫手。它不是让模型学会了修几何,是把「怎么把重试做聪明」包装成了一个方法论名词。
TraceCAD 干的事其实不大:特征、建模步骤、失败证据、候选结果。本来散在 agent 各次调用里的东西,它用一个持久状态串起来。哪一步生成了烂几何,先诊断哪一步可疑,再划一块依赖区域进去做局部编辑,改完验证。合格的存技能库,下次复用。
翻译成人话:把错误日志存进数据库,划定范围,然后重试。
「Repair」这词多值钱啊,谁听了都以为模型终于能自我纠错了。翻开看不是。它修的是重试的路径,不是几何生成的本事。往小了说这是包装,往大了说,是把工程贡献写成了方法论突破。
但别急着骂。消融数据是硬的。
把持久状态拿掉,恢复分数几乎减半。把局部化搜索拿掉,几何误差翻倍,agent 调用次数翻倍。两个数字还是互相独立的——拆掉前者,说明「记得住上下文」是承重墙;拆掉后者,说明「划范围找错」确实比大海捞针便宜一个量级。
这组数据出来我愣了一下。按惯例,这种「拆了我就废」的结果多半是模块耦合太深,或者 baseline 本来就弱。这次不是。TraceCAD 没给基座模型增加任何新能力,它就是把补救这件事做成了系统。闭环搭得完整——诊断、编辑、验证、记忆,四步以前没人串过。
然后丑话来了。它拿来对比的 baseline 是谁?明眼人看得出,核心对照是「自己有 vs 自己没有」,不是「我 vs 当代最强」。这等于把上楼梯和坐电梯分成两个对照组,然后宣布电梯快。实验设计从第一行就把结论焊死了。
有一处我得替它说句公道话:技能库初始化用「不重叠的训练模型」。这三个字把数据泄漏那扇门焊死了,很多做 LLM agent 的论文没这个自觉。该夸的,我不省。
锐评评分卡:冲着「agent 终于会修 CAD 几何」去读的,冤。冲着「搭一套可复用的修复基建」去读的,不冤。十八页正文七个图,这个篇幅本身就是话术——工程贡献写成方法论鸿篇,学术界的通稿,一样得拿照妖镜照。照完,货是真的,「Repair」是烫的。别照着标题付费。
