跳到主要内容
几页 Markdown 也算仓库资产:RAMP 这张图我第一版画错了

几页 Markdown 也算仓库资产:RAMP 这张图我第一版画错了

画唠
画唠

· 阅读约 5 分钟

arXiv 2608.25241,题目起得一点不抓人,A Few Pages of Markdown。八月挂的 v1,九月中补了 v2,八个作者。没人转给我,我大概就划过去了。

但最值钱的那个数不在这几个时间点上。是 73.8%。不是那个四级模型,是这个数。等会儿说为什么。

先画开它在量什么。

我第一版以为,"AI 配置"就是聊天框里那段东西——你敲在前面的那几行规矩、那份 CLAUDE.md、那个 .cursorrules。

等等等等,先别急。这里恰好就是我画错的地方。

RAMP 量的不是你怎么用 AI,是你把什么提交进了版本库。行为规则、编码规范、具名 agent 的定义、多智能体编排——这些得作为文件躺在 repo 里、被 git 记下来,才算数。聊天框里敲得再漂亮,没提交,人家当你不存在。

这个区分我一开始没当回事。后来才反应过来,整篇论文的重量全压在这上面。

画张图,这四级大概长这样:

L1   行为规则 / 编码规范      一句话的"你别这么干"
L2   具名 agent 定义          起名字、划职责、绑工具
L3   多智能体编排            几个 agent 之间怎么互相喊
L4   ……论文里基本没见着活体

441 个 repo,独立人工标注在留出样本上复现一致率 97%。这条别跳过。97% 说明层级之间的边界是清楚的,换个人照着规则标,能标出同一个东西——不是那种"看感觉分档"的成熟度模型,那种你换个人标就散架。

第一版我把这张图画成了向上的阶梯。团队一级级往上爬,越高越强,爬到 L3 就叫成熟。

然后我撞上 73.8%。


73.8% 的工件只被提交过一次。提交之后,再也没改过。

我盯着这个数看了半天。咔哒一下扣上了——这不是阶梯,这是沉积层。✨

阶梯是你往上走,下面那级就被抛在后面;沉积层是一层压一层往上盖,每一层盖完当场冻住。你 L1 写的那几行"不要用 any",三个月后还在那儿,原封不动,agent 每开一个新会话都从第一行读到那儿。

我以为的:   L1 ──► L2 ──► L3          爬梯子,越高越强

实际的:     L3  ━━━━━━━━━━   最新的,可能还在动
             L2  ━━━━━━━━━━   冻住
             L1  ━━━━━━━━━━   冻住
                  ↑ 只往上加,不回头改

论文自己的说法是:累积、只向前推进、设置后不再改动。累积是好事,说明确实有人在一层层往仓库里加东西,不是嘴上说说。"不再改动"是另一回事——它意味着这些文件写完之后,再没人回去看过一眼。

打个比方:这特别像给新同事写的那本入职手册。写一次,贴墙上,从此没人翻。

这个比喻在哪里漏风?我一开始觉得严丝合缝,后来发现漏得挺厉害。

手册是给人看的。人不是照本宣科的机器。他读到一条过时的规范,会自己判断,会来问你,会在心里打个折。手册写死了也没关系,因为读它的那个东西是活的。

AI 配置不是。读它的东西没有项目记忆,没有"这条好像不太对"的直觉,它每次开新会话,从第一行读到最后一行,照单全收。

所以"给同事写手册"和"给 agent 写配置",看着是同一件事,其实不是。手册是冗余的提醒,配置是决定性的输入。手册放着不动,最多是没人看;配置放着不动,是每一次执行都按一个三个月前、没人验证过的判断来跑。

代价不对等。而 73.8% 说明,大多数人还在用前者的心态管后者。


质量那段,是我最想泼冷水的地方。

论文里有个数:在能识别出对比的 agent 优先仓库里,没提交 AI 配置的仓库,认知复杂度增幅大约是有配置的两倍——+53% 对 +27%。静态分析告警是后者的 1.7 倍。

这数一出来,已经有人在传"配了 AI 配置,代码质量好一倍"。

别急。作者自己先把话钉死了:成熟度是观测性指标,工程纪律或模型能力的差异都可能解释掉一部分质量差距,所以结论定位成"生成假设"。RAMP 是当工具放出来的,不是当 KPI 放出来的。

翻译一下:会不会是那些本来就爱管代码质量的团队,恰好也更爱把配置提交进仓库?很有可能。这俩东西是同一种"在意整洁"的性格的两个出口。作者没否认这点,作者自己先说了。

所以我不会说"配了就好"。我说的是:回去翻一眼自己的 repo,有没有一份提交过的、还在被读的配置。没有的话,那个 +53% 是不是正发生在你身上,你自己心里有数。

速度那部分我觉得比成熟度模型本身有意思。

作者在每一层内部重估了一遍既有的智能体采用面板数据,发现编码 agent 让提交量涨了 28% 到 38%——不管你在哪一级,都涨。

并排画出来:

                  提交量涨幅      认知复杂度增幅
没配置的仓库        +28~38%         +53%
有配置的仓库        +28~38%         +27%
                       ↑              ↑
                  跟成熟度无关    跟成熟度有关

加速是 agent 自带的,你配不配它都加;分化只出在质量上。也就是说,你没法靠"不配"躲开它带来的速度,只能靠"配"去影响它带来的那部分熵。

这句同样踩在"生成假设"的限定上。别拿它当定论,拿它当"值得自己回头看一眼"。


L4 我没画。论文里也说实际观察主要集中在前三级,多智能体编排往上那档基本是空的。

这一段我也还没完全想明白——是 L4 太难没人够得着,还是 L3 已经够用、没必要再往上?两种解释指向完全不同的东西,我现在分不出来,先放着。

自检留一个:现在你能不能用自己的话讲明白,为什么"提交进版本库"这件事,是这篇所有数字的前提?

讲不顺、卡住的地方,多半也是我卡住的地方。

本期画开:你以为 AI 配置是聊天框里的一段话,其实它是一份躺在仓库里、被反复读、而且大概率没人再改过的文件。太酷了——酷在这么小的一个动作,能撑起 441 个 repo 的质量差异。

画唠
画唠

把被讲玄的概念用图 + 比喻 + 动手实验拆到咔哒扣明白,错的也保留。

查看主页 →