跳到主要内容
3.1% 的 CI 配置匹配率,AI agent 这活真接不住

3.1% 的 CI 配置匹配率,AI agent 这活真接不住

嘴替
嘴替

· 阅读约 5 分钟

速评:LLM 从自然语言生成 CI 配置,完全匹配率最高 3.1%。这不是“还不够好”的问题,是“根本接不住”的问题。

Doc2CI 这篇预印本够狠的。14 个开放权重模型加 GPT-4o、GPT-4.1,生成了超过 53000 个配置,最高的一致率 3.1%。什么概念?一百个请求里,能和你脑子里想的那份配置一字不差的,三个。剩下九十七个,理论上都是“分歧”。

有人可能会说,CI 配置而已,差不多能跑不就行了。这话放在别的场景成立,放在 CI 上就是灾难。

语法正确是最低门槛,模式校验才是生死线。一个字段名拼错,一个缩进层级不对,流水线直接挂。论文里有个数据特别有意思:97% 的输出能解析成合法 YAML,但只有 71% 过得了对应服务的模式校验。将近三成的输出,长得很像配置,实际上是一堆服务端根本不认的废纸。这个落差才是 LLM 碰 CI 配置的真实画像——不是不会写字,是不知道规则。

干过这行的人都知道那种玄学时刻:为什么这么写就能跑,那么写就报错,没有任何道理可讲。你让模型生成一份构建脚本,它给你列一堆看着眼熟的 step,YAML 校验也过了,一跑就跪。因为 CI 配置的有效性不在语法层,在语义层——模型从来不知道某个 action 的某个输入参数是 required 的,它只是见过。见过的和知道的,差着十万八千里。

论文里说“针对代码任务专门训练的模型相比通用模型没有持续优势”,这结论我一点都不意外。代码特化模型吹了两年了,实际效果呢?还不是通用的那几个换个数据集的微调版。我一直怀疑“代码特化”这个标签的有效性——你拿大量 GitHub 仓库去训练它写代码,它确实擅长续写,但 CI 配置它见过的相对少太多,代码特化的优势在配置生成这个任务上自然就消失了。这个发现不算石破天惊,但它让一个一直模模糊糊的感觉变清晰了:特化不是万能的,得看任务在你的训练分布里占多大比重。

再说那个模式引导修复方法,把模式有效性提到了 94%。看到这个数字我先打了个问号——怎么提的?靠规则修复,不是靠模型自己学会。这反而印证了我的判断:与其说 LLM 能生成配置,不如说它生成个大概,再靠人工规则兜底。这哪是“AI 写配置”,这是“AI 写草稿,人来擦屁股”。94% 看着好看,但剩下 6% 掉链子的时候,还是得人上手,省的时间全花回去了。

这个 94% 大概率会被拿来当“模型+修复就能用”的证据。但仔细看,修复方法是基于服务模式校验的规则做的,等于给模型输出套了一层强制的规范化。方法本身有启发,但它依赖的是既有模式的定义,新服务、新模式它没辙。说到底是规则的胜利,不是模型的胜利。这剧本,眼熟——当年静态分析工具也是这么吹的。

微调提高了“与文档的相似性”但降低了“独立有效性”,这是全文最耐嚼的一块。为什么?因为微调的目标是让模型学会模仿文档里的写法,但文档是描述性的,不是规范性的——你模仿得越像文档,越容易学到文档的“语气”,忽略文档的“规则”。相似性和有效性是两回事,这在配置生成这种任务上被拆得清清楚楚。你要的是能跑的东西,不是像文档的东西。这直接掀了 vibe-coding 叙事过去两年的核心假设:默认模型在模仿人类写法的时候,能同时把握住背后的逻辑。配置生成这个场景告诉你,逻辑和模仿是可以脱钩的。

我知道有人要说我泼冷水泼得不对,这实验用的都是非 SOTA 模型,GPT-4o 和 4.1 也就那样,Claude 的 Opus 可能更好。说得没错,但问题不在天花板在哪,问题在这类任务的天花板本来就低。3.1% 是最高水平,退一步,就算新模型能达到 10%,CI 配置是走钢丝,不是写诗,90% 的准确率意味着十分之一的概率踩空。踩空的代价是构建挂掉、发布延迟、你周报里多写一行“修复 CI 配置”。

这也不只是 CI 配置一个场景的问题。只要任务的验收标准是“跟参考方案一模一样”,LLM 就永远在赌概率。真正该问的不是“模型能不能生成配置”,而是“这个任务本身适不适合让模型生成”。CI 配置长年变更频繁、逻辑琐碎、每种服务有自己的怪癖,这恰好是模板引擎和人工规则最擅长的领域,硬套生成模型,属于用错了工具还怪工具不好使。

还有,看到“我们评估了 14 个模型”这种大规模横向对比,我第一反应是背后有多少人日是跪在地上改 YAML 缩进跪出来的。生成 53000 个配置,人工分析 385 个样本——385 个,不是 53000 个。剩下五万多个,都是拿脚本比对了一下字符串就完事。这也不是什么死罪,但你要拿这个当“AI 编程能力”的证据,先把那 385 个人工分析样本里的分类体系仔细看一遍再说。

我在这行待得够久,见过太多“AI 要取代 X”的通稿,最后都变成了“AI 帮人更高效地做 X”。CI 配置这个场景大概率也是这个归宿——模型当个自动补全插件行,当独立 agent 免谈。去年有人喊 AI agent 要从辅助变成自主,今年这些 agent 连 GitHub Actions 的 workflow 都写不利索。

立个 flag:明年这个时候,会有一波“基于 LLM 的 CI 配置生成器”的产品上线,然后被真实用户骂到悄悄下掉,或者默默降级成“模板推荐器”。到时候再来收。

3.1% 这个数字就算过几个月被刷新成 10%,我这几句话也还是站得住——能跑通和跑得对,是两码事。

评论

还没有评论,写下第一条讨论。