跳到主要内容

64 页的 agent 论文,值钱的就一句话

毒角兽
毒角兽

· 阅读约 5 分钟

先说结论:9 月 13 号挂上 arXiv 的 El Agente Potente,标题里「High-Throughput」和「Agentic」两个热词凑齐了,但真正值钱的只有一件事——它把 LLM 从执行链里踢了出去。

标题写着 agent,架构里 agent 只干两件事:规划,路由。

动手算的是确定性 Python。

就这一条,比我最近看过的大半「科学 agent」演示话术都诚实。

这半年「agent 全自动做科研」的稿子我看得有点腻。演示视频里从假设一路绿灯跑到结论,换自己那批带缺陷的数据进去,第三轮就开始编参数。原因不复杂——大多数设计把 LLM 塞在执行链正中间:它写代码,它跑代码,它看输出,它决定下一步。每一环都是幻觉的入口,串起来就是复利。

这篇换了条路。带类型的执行图先把工作流定死,结构化、可追溯,LLM 的活动范围压到规划和路由两个格子里。剩下的交给确定性代码,算数、验证,都轮不到模型插手。

论文自己的措辞很客气,说什么「把大语言模型的作用限制在规划与路由环节」。翻译成大白话:不许碰数字。

第二条腿是编码代理。需要更高流程灵活性的任务,让它现搭定制工作流。听着像放开了,其实没放——它只能调已有的 Potente 函数,受支持的计算之外照样动不了。

论文管这叫「互补机制」。

机制是互补的,前提是一个:LLM 没有执行权。

所以我要挑刺的地方也在这儿。论文结论说这两条路「兼顾受控可审计的执行与定制模拟所需的灵活性」——这话说得没错,但「兼顾」是个谁都不站的安全词。真问题在边界划在哪:什么样的任务该走执行图,什么条件下才轮到编码代理上场?

我没在稿子里读到一个能照着判断的阈值。

上面这些,我一条都没实测。

它没给我能跑的东西。没 repo,没 API,只有一份 PDF,外加实验性 HTML 和 TeX 源码三种访问方式。照妖镜这次照的是文案,不是实物,别把我这半句当结论。

不过论文里有一段我格外在意:它给了关于可重复性和 LLM token 成本的系统性基准。

这个动作本身就稀缺。agent 论文一年出多少篇,肯把「这个任务烧掉多少 token」写进正文的有几个?

不写的原因不难猜。成本数一上桌,那套「10 倍效率」的话术就撑不住了。形容词最怕的就是账单。🙃

我尊重它把这个数摆出来。但我要看的不只是总量——我想看的是执行图和编码代理这两条路各自的账单差多少。同一个任务,被关进笼子的那个 agent 是不是真的更省。这张对照表如果不在正文里,那就还是老规矩:脏活塞进补充材料。

说到这个:

总篇幅:   64 页 / 16 图 / 3 表
其中正文: 24 页 / 6 图 / 1 表

40 页在补充材料里。正文 24 页是给评审看的,剩下的是给真动手的人看的。照着正文那 6 张图去复现,大概率卡在半路。

再看它挑的演示场景:计算材料发现、分子能量景观探索、吸附、催化反应。

这是这个领域的老四大件,算例结构清晰,边界条件好写,收敛性也容易讲。能在这四类上跑通,说明不了别的。你手里那批中途断过、带着噪声的轨迹能不能喂进去,它没说,我也不知道。这条我保留,不站队。

顺便说个无关紧要的细节:DOI 到现在还挂着注册待完成。

论文 9 月 13 号提交,今天 25 号,十二天。十二天的东西,谁也别急着封神。去年被某个「限时」话术骗着续了年费那回我就学乖了——挂出来和交付出来,中间那段距离,永远比宣传稿上写的长。

前面那段话,我得自己拆一下。

我这次整篇都在夸它的架构判断,这不正常。逢新必踩和逢新必吹一样不可信,但一篇偏负面的评测里突然全是好话,读者该警觉——我警觉的地方是:架构判断对不对,跟这套东西跑起来管不管用,是两回事。前者我在稿子里能读完,后者我读不到。

架构判断这几百字,我在稿子里能读完;跑起来管不管用,我读不到。这两件事之间隔着一份 PDF 和一行不存在的安装命令。

所以这篇的分,我只能给到「值得读」,给不到「值得信」。

锐评评分卡:

这不是个产品,我没法告诉你这钱花得冤不冤,因为不收钱。

它值不值得花时间?值。值的不是那套 agent 叙事,是那句「LLM 只管规划和路由、计算交给确定性代码」的架构判断。你要是在给自己项目搭 agent 流程,拿这两条对着自己的执行链过一遍,比我拆十篇通稿都有用。

至于它自己——等代码放出来。那之前,那 40 页先当科幻小说读,读完了再决定要不要照着自己改。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →