为什么隔一阵就有人提"让 AI 自动复现论文"?
上月底挂出来的一篇,叫 DeepRepro,就是冲这个去的。挂在 arXiv 软件工程分类,也被 CIKM2026 的 Demo Track 收了。
一句话讲清楚:它不解决"代码写不出来",它解决的是"写着写着,开工前那份计划全过期了"。
老做法是先规划,再按文件顺序往下写
现有的这类系统基本都是这个路子。开工前把整个仓库怎么搭规划一遍,然后一个文件一个文件往下生成。
静态任务里够用。复现论文不是静态任务。
复现要的不是"跑起来一次的代码",是"改一处还能继续跑下去的代码"。数据预处理、模型结构、训练循环,任何一处假设错了,整条链就断在那儿。依赖、接口、报错,本来就在一路变。前期那份规划从第一天起就在欠账,越往后越还不上。
DeepRepro 把计划做成活的
它的做法是读仓库当前的状态和运行时反馈,再动态生成下一步的细粒度子计划。规划和执行状态在整个构建过程里保持对齐。
它管这个叫状态感知子规划。名字听着玄,事不玄。就是把"规划"从一次性动作,改成一路刷新的动作。
白话版:别在开工前把整条路画在纸上。走两步,抬头看一眼现在站在哪,再决定下一步。
这里的"状态"指什么?仓库里有哪些文件,跑过哪些命令,报过什么错,哪些接口已经定下来。这些东西每走一步都会变。规划要是不读它们,就是在凭空写。
它还有个盯梢的接口
框架里另有两块。一个是面向仓库的编排,一个是轻量的过程感知接口,盯着长周期复现的进度。
这条我觉得比它的实验数字更值得抄。
长任务最烦的不是它做错,是你不知道它做到哪了、正在干什么、卡在哪一步。任何跑超过十分钟的 agent,如果不告诉你当前状态,你就是在赌。
实验在 PaperBench Code-Dev 上做的
论文说它在几个科学类和商业类的代码 agent 基线上持续占优。
好多少?只有一句"持续优于",数字我没看到。这条我只看懂一半,先放在这儿。
收进的是 Demo Track
Demo 的意思是,不用指望它把整个方向改掉。
一个小系统,讲清楚一个取态,就算合格。它的取态是计划得跟着执行状态走。这个取态比它自己的成绩单重要。
我不觉得这篇能让"一键复现论文"马上成真。它更像是在说清楚这件事为什么难。
把它挪到自己身上,其实就是改一个顺序。
现在不少人用 Claude Code 或者 Cursor 做东西,第一步是让 AI 出一份完整方案,然后照着方案一路推。推到三分之一就开始不对劲,函数名对不上,接口改了没人通知,之前写的测试全红。
换个顺序:先让它把最小的一块跑起来,跑通了,再根据仓库现在的样子重新排下一步。
计划不是拿来执行的。计划是拿来随时重写的。
这类东西我收过不止一次,每次都说自己是动态规划,实际上大多只是把 prompt 拆细了一点。这篇至少把"状态"两个字说清楚了。而且说的不是模型的状态,是仓库的状态。这个区别,是它和那些换个说法的东西之间唯一的分界线。
对普通人来说,你不用去读这篇论文,但今天就能试那个动作:让 agent 先跑一小段,看反馈,再排下一步。不需要任何准备。
至于订阅费那笔账,还是老话。先拿免费额度把一个真实的小项目跑通再说。跑不通,再好的规划方式也救不了。
上面那个状态、反馈、再规划的循环,比它具体用了什么编排机制重要得多。机制是别人的,习惯是自己的。
本周就这些。
上面有任何一条你试过,或者觉得我讲错了,欢迎告诉我。讲错的我补,没讲清的我改。
下周见。
