跳到主要内容
这篇论文最值钱的不是赢了 bench,是把实验室失传算成了一笔账

这篇论文最值钱的不是赢了 bench,是把实验室失传算成了一笔账

算账先生
算账先生

· 阅读约 6 分钟

这篇论文我第一眼看完,脑子里就一句话:它没解决“实验室失传”,它只是把“实验室失传”算成了一笔账。别把它当解药——解药是吃了能好,账本是让你看见病在哪、值多少钱。往下算。论文里那套东西,把“复现”的账算得很漂亮:你让它去跑一篇已发表论文的图,它能跑出来,还跑得比商业通用智能体好。但这叫复现,不叫继承。复现是“能不能做出来”,继承是“能不能接着往下做”。这篇论文只把“怎么做”留下了,“为什么”还在人脑里。说句扫兴的,这不是挑刺,这是这件事的真问题。

作者名单里有 James Zou、Hongyu Zhao 这些人,都自己带实验室。他们太清楚一个学生毕业时实验室丢的到底是什么——不是那套代码,是代码之外那堆说不清的东西。“实验室失传”这四个字是一笔多大的账?在生物和计算交叉的圈子里,这事太熟了,熟到没人认真算过。一个博士生四年,前两年在试错,后两年出活。走的时候留下什么?一份没写注释的代码,三个只有他自己知道的环境配置坑,四份没同步的协议草稿。实验室要把这套方法捡回来,成本是多少?一个刚入学的博士生六个月起步,还不一定跑得起来。这六个月,工资、设备、机会成本,按北美标准粗算就是三到五万刀。还没算“捡不回来”的情况——有时候方法是真捡不回来了,只能从零重做,那笔账就翻倍都打不住。LabAgent 要是能把“六个月”压到“两周”,这笔账就很划算。但注意,它压的是“复现”的时间,不是“重新理解”的时间。复现时间压缩了,不代表那个新人不需要再从头理解一遍这套方法为什么这么设计、哪一步不能乱动。这俩又回到开头那笔账上去了。

它那两条机制说白了就是:第一,技能必须能被执行、被验证;第二,跑出来的错、改法、经验全记下来,下次直接修正或者绕开。像不像老员工交接时写的坑文档?人写的坑文档最大的问题不是写不好,是留不住——写完就放那儿了,没人更新,过半年就成了历史档案。工具的好处是它一边跑一边记,账是活的。这是这篇论文真正有点意思的地方:它把“经验”从人脑里那团说不清的隐性知识,变成了一本可以审计、可以执行的账。这比 benchmark 高几个百分点值钱多了。我们看论文太多只看数字,数字背后的机制才决定这工具能不能活过下个学期。

然后说那个最扎眼的对比:为什么拿商业通用智能体当靶子?因为实验室跟商业通用智能体的关系,本质是一笔租和买的账。商业通用智能体是租来的认知——它不懂你的数据脾气,不知道你们组那台服务器的 Python 环境是 3.11 还是 3.11.0rc1。LabAgent 赢,不是它模型比人家强,是因为它把实验室自己的坑和修正都吃进去了。这是认知差从个人手里转移到系统里的过程。一个实验室养出来的方法,以前长在学生脑子里,走一个就少一块;现在能被系统接管,哪怕接得不全,也比全丢强。这笔账,PI 算得过来。

谁赚谁亏?PI 最大赢家,没什么好遮掩的。以前一个学生毕业,实验室那套方法就残疾一半,现在至少能留个能跑的东西。学生短期看也是赢家——不用再背“你是唯一能跑这个流程的人”这口锅,走的时候也不用被夺命连环 call 问环境变量。但长期看,你的不可替代性被摊薄了。一个能把方法系统化的实验室,对某个具体的人的依赖就是会更低。这不是坏事,但这是账。这笔账我一开始没想明白,总觉得这是个纯粹的好工具,后来才琢磨过来:工具越把经验固化,经验主人的议价权就越小。这跟程序员把公司代码文档化之后自己更好找工作还是更好被替代,是一回事。账面上看,文档化让交接顺畅了,公司离了你也照样转;但你自己身价也涨了一块,因为能写文档、能沉淀经验——除非你本来就只是个写代码的,那另说。这中间的账,每个人得自己算。插一句不相干的,我自己也在这条道上栽过跟头,具体不展开,但教训就一句话:算账要算到自己头上的那笔。

真问题在哪?在标题里那个“Discoveries”。论文里干的事是复现和纠错,离“发现”还差着一步。科研继承真正的难点,不是把已经发表的东西重做出来——那只是证明你能照着菜谱做菜——是没人告诉你方向的时候,你能不能顺着这套东西接着往下做。前者是技术问题,后者是判断问题。LabAgent 把前半段算得挺清楚,后半段还没开始算。我倒不是要求它现在就把“发现”也算进去,那有点为难人。但要是有人看完这篇论文就觉得实验室失传问题解决了,那又是一笔交认知税的账。

那怎么办?我要是自己在带实验室,会这么用它:别把它当省人力的工具,当它是资产沉淀的工具。让每个学生走的时候,不是留下一个只有他能跑的流程,而是留下一个被记过账、被验过证、能直接交接给下一个人的流程。账怎么算?把它当基础设施的钱花,别当省博士后的工资花。指望它替你省下一个人的成本,这账就错了——它省的是重复试错的成本,不是人的成本。人会判断、会审美、敢从数据里揪出那个反直觉的点,这些它现在还不占。你把它当基础设施,它就值那个钱;你把它当人力替代,它肯定亏。

这篇论文最值得读的,不是它证明 agent 能在四个领域把商业通用智能体比下去——这种 benchmark 赢法我们见多了,换个数据集就换血。值得读的是,它把“实验室失传”这个老问题,从咖啡机旁的抱怨,变成了一个可以审计、可以执行的账本。但账本记的是过去,科研的下半场是未来。能不能从“复现”走到“发现”,这篇论文还没把账算完。这笔账,下一步谁来算,我盯着。

算账先生
算账先生

用算账视角看 AI 工具这门生意——红利、认知差、护城河,泼完冷水给一条窄路。

查看主页 →