最近总有人问,agentic evolution 是什么。
简单说,就是让一个 meta-agent 自己写 agent 程序。写不好就改,改到满足你的预算为止。
8 月 17 号 arXiv 上有篇论文就是这么干的。作者叫 Andrew Borthwick。这期主要讲它。
RoboPhD:一个会写博士级 agent 的 agent
论文里的主角叫 RoboPhD,一个进化式的 meta-agent。
玩法是这样的。给你一份按价格排好的菜单,九个 LLM endpoint,从贵到便宜。你先定一个每道题的成本上限。然后它在这个预算里进化出完整的 agent 程序。
训练池最多 100 个例子。不是 100 万,是 100。
这个数字是全篇我最喜欢的地方。100 个例子就够进化出一个能打的 agent,说明真正起作用的可能不是数据量,是那个进化的循环本身。
Pareto 前沿被包场了
评测跑在两个任务上。DS-1000,执行检验的代码生成。PaperFindingBench,科学文献检索,由 LLM 当裁判。
结果它占了两个榜单上 Pareto 前沿的几乎所有位置,只漏了一个。对最高分和最低成本那两个对手,它都形成了 Pareto 支配。就是又便宜又好,两头都不输。
这个结果单独看很漂亮。但我想讲的不是这个。
真正值得抄的思路:先定价,再造货
传统做法是先把东西做出来,再看看成本多少。
这篇反过来。操作员先设一个每题成本目标,通常是去对齐某个现有对手的价格。然后 RoboPhD 在这个价格以内进化。
简单说,先定价,再造货。
这个顺序对普通人特别有意义。订阅费是真问题,我之前算过这笔账。一个工具的设计,如果从一开始就把“你打算花多少钱”当成第一输入,而不是做完了再让你看着账单心疼,那预算有限的用户就不是二等公民。
菜单里九个模型,从贵到便宜。进化过程自己决定哪一步用贵的、哪一步用便宜的。这其实就是普通人手动在做的事。难的那步开个贵的模型,简单的活丢给便宜的。只不过它把这件事自动化了,而且换得比人勤。
一点没想明白的地方
老实说,进化出来的 agent 具体长什么样,论文细节我只消化了一部分。它是怎么在九个 endpoint 之间组合调度的,哪些组合被淘汰了、为什么,这部分我还没吃透。
先放在这里。搞明白了再补一句。
另外 PaperFindingBench 的裁判是 LLM,这个我总有点保留。LLM 当裁判,打 LLM 进化出来的东西,分数会不会有偏,我说不好。不是质疑这篇的结果。是这种评测方式本身,我就没完全信过。
这对普通人意味着什么
回到老问题。这些和写不出代码的人有什么关系。
关系在于,这篇把“选模型”这件事的性质改了。以前选模型像考试,你得自己判断哪个聪明、哪个划算。现在它变成一个可以交给程序去搜的问题。你只出价格,程序去找最优解。
门槛从“你得懂模型”降到了“你得知道自己愿意花多少”。后者人人都会。
这和 vibe coding 是同一个方向的事。用自然语言和预算指挥机器,而不是用专业资格证明自己够格。菜单越丰富,进化越有用武之地。
又想了一下 100 个例子这件事
训练池那个数字,越想越觉得值得单独说一句。
100 个例子进出一个 agent,这件事如果站得住,说明后面真正稀缺的不是数据,是那个会进化的框架。
普通人手里没有百万级数据。但一百个自己领域的例子,很多认真做事的人是拿得出来的。这条线能不能往下走,值得再看几篇类似的。我还没看,先记着。
本周就这些。
上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。RoboPhD 那篇有读懂了的,尤其欢迎来给我讲讲。
下周见。