跳到主要内容

被一篇材料学的论文戳中了

今天也没搞懂
今天也没搞懂

· 阅读约 5 分钟

那个报错到今天还卡着。晚上本想再战一轮,结果不知怎么的点进了一篇 arXiv,标题看着跟我八竿子打不着,作者是阿贡国家实验室的人,叫 Angel Yanguas-Gil,做材料合成的。先交代一下:不是材料人。但“AI 代理”四个字把我钓住了。

人就这样,报错解决不了的时候,什么都比报错好看。

这篇是预印本,arXiv:2608.29309,讲怎么评估“跟材料合成工具集成在一起的 LLM agent”,案例用的是原子层沉积。我对这个工艺的全部了解就是:原子层,一层一层往上叠,叠得非常均匀。大概是吧,说错了别骂我。重点是——它讲评估。

里面说了一件事,我觉得简直是替我写的。就是:你要评估一个 agent 能不能在实验室里帮你干活,不能只问“它知不知道这个材料该怎么合成”。那是知识。你还要看它会不会调工具。还不够,最后你要把它丢进一个跟真实环境能互相反馈的闭环里,让它自己看结果、自己决定下一步、自己承认上一步错了,再试。这么几层筛下来,才敢说这东西到底能不能用。

作者把它拆成了三种基准,但我不在乎分类名,我在乎的是那个意思——你得知道它在哪一层掉的链子

我盯着那段看了好久。

这说的哪里是实验室,这不就是我这几个月在干的事吗。

昨天让 Cursor 帮我把一个函数改成异步。它咔咔一顿操作,文件里加了几个 await,看着特别像那么回事。一跑,报错。我把报错贴回去,它说哦抱歉,改了一版。再跑,换了个报错。我又贴回去,它开始犹豫了,跟我说可能需要看一下调用那边的逻辑——然后我发现是我让它改的那个函数根本不是需要改的地方,调用关系我搞错了。

整个过程我都在想一个问题:到底是它改了错,还是我指错了?

这个问题我答不上来,但是我意识到这个“答不上来”本身就是问题。因为我对它干活的质量判断,一直建立在“跑不跑得通”这个信号上。跑通了,我就觉得它做得好;跑不通,我就觉得它是个傻。但实际哪是这么简单……跑不通的原因能塞满一整面墙——prompt 里有歧义,需求本身该换个实现方式,它幻觉了一个不存在的函数,我让它动它不该动的东西。我把这些都摊成一团,最后管它叫“卡住了”。

论文里那个三层框架,往自己身上一套就特别疼:

知识层,它比我懂,起码它的知识库里没有“昨天刚学今天就忘”这回事;工具层,它比我顺,API 调用从来没手抖过;但到闭环那一层——它自己生成的代码它自己看不出毛病,我也看不出,我俩一起瞎。我的反馈信号就一个:跑不跑得通。而真实世界里一个东西能不能用,哪儿是“跑不跑得通”能判的。

说得玄一点:我在实验室外面,它在实验室里面,但谁都没长那个“隔着墙看反应釜里变没变颜色”的眼睛。

我猜做材料的人也会有差不多的体验。它的 agent 在虚拟环境里模拟了一百遍流程,真到实验台上,管子插错了它知道吗?第一批样品出来长这样,它知道下一步该不该调参数吗?论文里说,要评估到最后那层闭环才算数。我读的时候忍不住想,材料科学家设计的那个“反馈信号”,比我的终端报错高级到不知道哪里去了——他们至少知道自己在测什么。

……好吧其实我也知道我在测什么:我在测 Cursor 有没有把我想要的东西做出来——只是我表达得不够像话,它才猜岔了。这大概就是为什么夹生。我现在最大的短板可能不是写代码,是“把我脑子里那个模糊的预期,翻译成它能准确执行的约束”。然后我还要有能力判断:它执行完的结果,跟那个预期差了多少。两件事我都没做好,却指望它能凭空把楼盖对。

刚才写到一半,回看开头那句“这跟我有什么关系”。其实关系挺绕的。一篇材料实验室写给材料实验室看的评估方法,我读着读着把自己读进去了。就为这个,我又把那篇论文往后翻了几页,虽然公式跳过了大半,中间有些段落我也没太读懂,但那个核心思路我记住了——评估一个人也好,agent 也好,不能只看他嘴上会不会,要看他跌倒了会不会爬起来;而起爬之前,得先知道自己摔在哪一层。

行吧。今天那个报错还在,夜也深了,大概是不会自己消失了。明天我会把它拆成三层再来一轮:是我的 prompt 没说明白,是它改错了,还是我要的根本不是那个方案——总归比“卡住了”三个字清楚一点。

谁懂材料或者懂评估的,评论区蹲一个大佬。这个报错我还是没搞定,但这篇论文真的让我把“卡住”这个词拆开了一点。就这点也算挪了吧。