先说结论:9 月 13 号挂上 arXiv 的 El Agente Potente,标题里「High-Throughput」和「Agentic」两个热词凑齐了,但真正值钱的只有一件事——它把 LLM 从执行链里踢了出去。
标题写着 agent,架构里 agent 只干两件事:规划,路由。
动手算的是确定性 Python。
就这一条,比我最近看过的大半「科学 agent」演示话术都诚实。
这半年「agent 全自动做科研」的稿子我看得有点腻。演示视频里从假设一路绿灯跑到结论,换自己那批带缺陷的数据进去,第三轮就开始编参数。原因不复杂——大多数设计把 LLM 塞在执行链正中间:它写代码,它跑代码,它看输出,它决定下一步。每一环都是幻觉的入口,串起来就是复利。
这篇换了条路。带类型的执行图先把工作流定死,结构化、可追溯,LLM 的活动范围压到规划和路由两个格子里。剩下的交给确定性代码,算数、验证,都轮不到模型插手。
论文自己的措辞很客气,说什么「把大语言模型的作用限制在规划与路由环节」。翻译成大白话:不许碰数字。
第二条腿是编码代理。需要更高流程灵活性的任务,让它现搭定制工作流。听着像放开了,其实没放——它只能调已有的 Potente 函数,受支持的计算之外照样动不了。
论文管这叫「互补机制」。
机制是互补的,前提是一个:LLM 没有执行权。
所以我要挑刺的地方也在这儿。论文结论说这两条路「兼顾受控可审计的执行与定制模拟所需的灵活性」——这话说得没错,但「兼顾」是个谁都不站的安全词。真问题在边界划在哪:什么样的任务该走执行图,什么条件下才轮到编码代理上场?
我没在稿子里读到一个能照着判断的阈值。
上面这些,我一条都没实测。
它没给我能跑的东西。没 repo,没 API,只有一份 PDF,外加实验性 HTML 和 TeX 源码三种访问方式。照妖镜这次照的是文案,不是实物,别把我这半句当结论。
不过论文里有一段我格外在意:它给了关于可重复性和 LLM token 成本的系统性基准。
这个动作本身就稀缺。agent 论文一年出多少篇,肯把「这个任务烧掉多少 token」写进正文的有几个?
不写的原因不难猜。成本数一上桌,那套「10 倍效率」的话术就撑不住了。形容词最怕的就是账单。🙃
我尊重它把这个数摆出来。但我要看的不只是总量——我想看的是执行图和编码代理这两条路各自的账单差多少。同一个任务,被关进笼子的那个 agent 是不是真的更省。这张对照表如果不在正文里,那就还是老规矩:脏活塞进补充材料。
说到这个:
总篇幅: 64 页 / 16 图 / 3 表
其中正文: 24 页 / 6 图 / 1 表
40 页在补充材料里。正文 24 页是给评审看的,剩下的是给真动手的人看的。照着正文那 6 张图去复现,大概率卡在半路。
再看它挑的演示场景:计算材料发现、分子能量景观探索、吸附、催化反应。
这是这个领域的老四大件,算例结构清晰,边界条件好写,收敛性也容易讲。能在这四类上跑通,说明不了别的。你手里那批中途断过、带着噪声的轨迹能不能喂进去,它没说,我也不知道。这条我保留,不站队。
顺便说个无关紧要的细节:DOI 到现在还挂着注册待完成。
论文 9 月 13 号提交,今天 25 号,十二天。十二天的东西,谁也别急着封神。去年被某个「限时」话术骗着续了年费那回我就学乖了——挂出来和交付出来,中间那段距离,永远比宣传稿上写的长。
前面那段话,我得自己拆一下。
我这次整篇都在夸它的架构判断,这不正常。逢新必踩和逢新必吹一样不可信,但一篇偏负面的评测里突然全是好话,读者该警觉——我警觉的地方是:架构判断对不对,跟这套东西跑起来管不管用,是两回事。前者我在稿子里能读完,后者我读不到。
架构判断这几百字,我在稿子里能读完;跑起来管不管用,我读不到。这两件事之间隔着一份 PDF 和一行不存在的安装命令。
所以这篇的分,我只能给到「值得读」,给不到「值得信」。
锐评评分卡:
这不是个产品,我没法告诉你这钱花得冤不冤,因为不收钱。
它值不值得花时间?值。值的不是那套 agent 叙事,是那句「LLM 只管规划和路由、计算交给确定性代码」的架构判断。你要是在给自己项目搭 agent 流程,拿这两条对着自己的执行链过一遍,比我拆十篇通稿都有用。
至于它自己——等代码放出来。那之前,那 40 页先当科幻小说读,读完了再决定要不要照着自己改。