跳到主要内容

本周小抄:先定价,再造货

阿简
阿简

· 阅读约 4 分钟

最近总有人问,agentic evolution 是什么。

简单说,就是让一个 meta-agent 自己写 agent 程序。写不好就改,改到满足你的预算为止。

8 月 17 号 arXiv 上有篇论文就是这么干的。作者叫 Andrew Borthwick。这期主要讲它。

RoboPhD:一个会写博士级 agent 的 agent

论文里的主角叫 RoboPhD,一个进化式的 meta-agent。

玩法是这样的。给你一份按价格排好的菜单,九个 LLM endpoint,从贵到便宜。你先定一个每道题的成本上限。然后它在这个预算里进化出完整的 agent 程序。

训练池最多 100 个例子。不是 100 万,是 100。

这个数字是全篇我最喜欢的地方。100 个例子就够进化出一个能打的 agent,说明真正起作用的可能不是数据量,是那个进化的循环本身。

Pareto 前沿被包场了

评测跑在两个任务上。DS-1000,执行检验的代码生成。PaperFindingBench,科学文献检索,由 LLM 当裁判。

结果它占了两个榜单上 Pareto 前沿的几乎所有位置,只漏了一个。对最高分和最低成本那两个对手,它都形成了 Pareto 支配。就是又便宜又好,两头都不输。

这个结果单独看很漂亮。但我想讲的不是这个。

真正值得抄的思路:先定价,再造货

传统做法是先把东西做出来,再看看成本多少。

这篇反过来。操作员先设一个每题成本目标,通常是去对齐某个现有对手的价格。然后 RoboPhD 在这个价格以内进化。

简单说,先定价,再造货。

这个顺序对普通人特别有意义。订阅费是真问题,我之前算过这笔账。一个工具的设计,如果从一开始就把“你打算花多少钱”当成第一输入,而不是做完了再让你看着账单心疼,那预算有限的用户就不是二等公民。

菜单里九个模型,从贵到便宜。进化过程自己决定哪一步用贵的、哪一步用便宜的。这其实就是普通人手动在做的事。难的那步开个贵的模型,简单的活丢给便宜的。只不过它把这件事自动化了,而且换得比人勤。

一点没想明白的地方

老实说,进化出来的 agent 具体长什么样,论文细节我只消化了一部分。它是怎么在九个 endpoint 之间组合调度的,哪些组合被淘汰了、为什么,这部分我还没吃透。

先放在这里。搞明白了再补一句。

另外 PaperFindingBench 的裁判是 LLM,这个我总有点保留。LLM 当裁判,打 LLM 进化出来的东西,分数会不会有偏,我说不好。不是质疑这篇的结果。是这种评测方式本身,我就没完全信过。

这对普通人意味着什么

回到老问题。这些和写不出代码的人有什么关系。

关系在于,这篇把“选模型”这件事的性质改了。以前选模型像考试,你得自己判断哪个聪明、哪个划算。现在它变成一个可以交给程序去搜的问题。你只出价格,程序去找最优解。

门槛从“你得懂模型”降到了“你得知道自己愿意花多少”。后者人人都会。

这和 vibe coding 是同一个方向的事。用自然语言和预算指挥机器,而不是用专业资格证明自己够格。菜单越丰富,进化越有用武之地。

又想了一下 100 个例子这件事

训练池那个数字,越想越觉得值得单独说一句。

100 个例子进出一个 agent,这件事如果站得住,说明后面真正稀缺的不是数据,是那个会进化的框架。

普通人手里没有百万级数据。但一百个自己领域的例子,很多认真做事的人是拿得出来的。这条线能不能往下走,值得再看几篇类似的。我还没看,先记着。

本周就这些。

上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。RoboPhD 那篇有读懂了的,尤其欢迎来给我讲讲。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →