跳到主要内容

本周小抄:多智能体贵在哪,这篇论文想管账

阿简
阿简

· 阅读约 4 分钟

多智能体工作流为什么这么烧钱?

简单说,整条链路里没有一个环节在管账。arXiv 上这篇 ProgRouter 就是冲这笔账来的。

一轮任务下来,模型反复调用,上下文越滚越长。论文写得很客气,叫"显著的运行开销"。白话版是:agent 跑一晚上,第二天看账单你会安静一会儿。

本来不打算收这条。名字像个路由器,点进去全是 orchestration、元门控、双路径预测器,一股"我很复杂"的味道。读下去发现剥开就一句话,那就值得收。

它动的是路由决策发生的位置

已有的级联路由,是在收到问题的那一刻做一次判断:这个查询用哪个模型。然后整条链路照着这个决定走到底。

多步工作流不是一道题。

拿改代码的任务说,先读文件、再定位、再改、再跑测试。第一步和最后一步都不需要最贵的模型,真正难的只有中间那一小段。用一个决定管全程,结果要么贵,要么废。

ProgRouter 的做法粗暴得多:每一步重新决定一次。

判断依据有三样,第三样是重点

任务走到哪了,剩下的活有多难,这一步值不值。

前两样好理解。第三样才是这篇想说的:不是"这步配不配用大模型",是"这步用了大模型,能不能换来对应的进度"。

论文管这叫进度增益,归在 quality-cost tradeoff 底下。翻成白话:花了贵模型的钱,得看见活往前挪。

具体做法上,它有个多视角进度评分器,一边看工作流整体状态,一边看子任务完成度、进度趋势、状态质量这类细粒度信号。再往上是双路径进度预测器和元门控,用来估每个候选模型能带来多少增益。每一步在线决策,同时掂量进度增益、时间预算和长期成本。

元门控那部分我只懂一半。先放在这里,搞明白了再补一句。有读通的欢迎回来给我讲讲。

实验跑了四类基准

HumanEval Plus 和 MBPP 是代码,MATH-500 是数学推理,ASQA 是检索增强的长文本问答。论文的结论是,和几个关键基线比,解题表现保住的同时成本降了。

这类结论我一向留个心眼。表现不掉、成本还降,通常意味着某个前提写在比较靠后的位置。不过这篇是上个月月底挂上去的 arXiv,v2 月底更新,已经被 EMNLP 2026 的 Findings 收下。审稿人认这套设定,至少说明它不是自说自话。

编号和 DOI 我不写。索引的事留给索引。

比论文本身更值得看的,是它出现的时机

前两年"多智能体"在圈里的形象基本是个 demo 玩具,套几层 agent 就能录个视频。现在有会议愿意收一篇专门讨论调度和成本的工作,说明这事开始被当成正经题目处理。

这个转向对普通人的意义,不在论文里。

在于你在 Claude Code 或 Cursor 里挂一个长任务跑着,面对的是同一笔账。全程用最贵的,心疼。全程用最便宜的,任务做废了更心疼。中间那个度,论文叫在线决策,白话叫"这一步值不值得上贵的"。

现在这个判断是你自己拍的。以后工具大概会替你拍。拍得准不准,另说。

留个白话版

只想记一句:多智能体省钱的关键,不是少调几次模型,是每一步都重新决定一次用谁。

我本来想写"选对模型",写完发现不对。选对是结果,每一步重算是动作。

另外提醒一句,论文全文能读,PDF、实验性 HTML、TeX 源码都公开了。能不能直接搬进你自己的工作流里用,我没试过,别把一篇 Findings 当成一个能装的东西。

本周就这些,只有一条。这几天的动静里,只有这条我能一句话讲清楚它对普通人意味着什么。剩下的要么我没看懂,要么看懂了也讲不出一句有用的话,就不占版面了。

上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。讲错的我补,没讲清的我改。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →