"多智能体"这词现在的待遇,跟默认选项差不多——一个 agent 搞不定的,堆三个上去总没错。
我先撂结论:多数时候你在白烧钱。而且烧得最狠的,恰恰是那些根本用不着协作的题。
来看数。有人拿 614 道代码题(APPS、HumanEval+、LiveCodeBench 拼的),按难度切三分位,量了分层协作比单智能体多赚多少分:
相对单智能体的 pass@1 增益
最简单 1/3 +2.4 分
最难 1/3 +21.1 分
同一套协作结构,同样的拓扑。简单题上就值 2.4 分,难题上值 21.1 分。而它的 token 成本,是单智能体的十倍。
2.4 分买十倍成本,这账谁算谁知道亏。可你的流水线里拓扑是写死的——所有题都走同一条路,简单题也拉一整队人陪你走流程。
有篇论文把这层挑明了,Yunsong Hong 写的,9 月 12 号挂的 arXiv,2609.13890。标题那句我觉得说得很直:固定拓扑的选择粒度不对。它做的东西叫 Difficulty-Aware Topology Selector,DATS。
等等等等,先别急。我第一版理解 DATS 的时候画错了图,而且错得挺典型,值得摆出来。
我以为它是这样的:先判断这道题难不难,然后查一张表——简单题走单智能体,难题走分层协作。
问题 ──► 判断难度 ──► 查表 ──► 选定拓扑
一条线,多顺。然后我对了一下原文,发现不对。如果只是"难度分类 + 查表",那拓扑本质上就是个五选一的分类问题,五个标签彼此独立——那跟一个平坦的多标签分类头有什么区别?可论文里明明白白写着,平坦的多标签头效果差 1.7 分。
也就是说,"难度查表"这个理解,把论文最要紧的那一步给抹掉了。
重来。它真正干的事是:对五种拓扑各预测一个"解出这道题的概率",各自扣掉成本,再取剩下的最大值。
问题特征 ──► 图网络 ──► 五个拓扑各自的 P(解出)
│
├─ 各自减成本(越大扣越多)
│
└─ argmax ──► 选中的拓扑
关键在那一步减成本上。成本惩罚是个标量,而且可以重新校准,不用重训模型。这一条我觉得是整篇里最实的一块——成本一旦能拧,同一个模型就能被扔进不同预算里衡量:预算紧就拧大,预算宽就拧小。反过来说也一样,那句"我的方法比你强",不把成本口径对齐,根本没法比。
论文里就做了这么个预算匹配的实验。把成本固定在"始终用分层协作"的 40%:
始终分层协作 73.6%
最强学习型竞争方法 74.3%
DATS 77.7%
4.1 分的差距,十一项成对比较都过了 Holm-Bonferroni 校正,不是噪声。
但真正让我坐直的是另一句:六种成本感知方法在同一预算下,表现跨度有 21.6 个百分点;而原先领先 DATS 的两个基线,跟 DATS 校准之后掉了。
21.6 个百分点这个跨度,比 DATS 自己赚的那 4.1 分大得多。这说明什么?说明过去那些"谁领先谁"的结论,很大一部分是成本口径不同造出来的幻觉。我不觉得这是论文在踩别人,但它确实把一件事摆上台面了——路由这种东西,单看 pass@1 是看不出来的,得看你在什么预算下比。
回到那个 1.7 分。为什么把五种拓扑当成"连通顺序上的节点",就比当成五个独立标签好?
我盯着想了一会儿才顺过来:因为这五个拓扑不是五个平行的选项,它们排在一条协作强度的轴上。从单智能体,一路排到分层协作,中间那些是相邻的、彼此像的。当成独立标签,模型得为每个标签从头学一遍;当成链上的节点,相邻的相似性就能被共享。1.7 分不大,但它是"方向对了"的证据。
顺着这条线还有个对照挺有意思:把图网络或预训练编码器,换成 39 个人工可解释特征,准确率最多动 1.3 个百分点,都不显著。意思很明确——特征工程不是这里的瓶颈。
还有两件事让这套东西看着不像刷出来的。一是那 4.1 分的增益,在四个能力相差 14 分的骨干模型上都稳。二是换到 400 道数学推理题上,那个"简单题收益小、难题收益大"的效应又出来了,差距从 2.5 分拉到 20.9 分。
数学题上的复现,我觉得比编码那边的数字更说明问题。它说明这不是代码这个任务的性质,是协作这件事本身的性质——协作的价值随问题难度上升,不随任务领域变。
打个比方:多智能体流水线像个施工队。一道小活儿请一整队人来,协调成本比干活成本还高;一道大活儿一个人扛不动,队伍立刻回本。所以问题从来不是"要不要请队伍",而是"这活儿值不值一队人"。
这个比喻在哪里漏风,我得标出来。施工队的人数离散、成本大致线性;而这里的 token 成本是十倍,是个不便宜的量级,拓扑之间的成本差也不是线性的。所以"请不请队伍"能靠感觉判,"请几档的队"就得靠模型算。比喻帮你抓"为什么简单题上协作是浪费"这个大方向,抓到这儿就够了。
💡 顿悟那一下是这样的:DATS 真正做对的不是"预测难度",是把成本摆到跟成功率同一张桌子上权衡。难度只是输入之一,成本才是那个决定"该不该协作"的东西。
留个自检吧:你现在那条流水线里,哪个问题是配得上十倍 token 成本的?如果一时说不出来,大概率一个都不配——而你的拓扑还是写死的。
下期想画开哪个?我候选清单上排着两个:MCP 的权限边界到底画在哪一层,还有 KV cache 凭什么能省那么多。哪个先来你说了算。
