跳到主要内容
本周小抄:有人认真测了多智能体框架,没测出差别

本周小抄:有人认真测了多智能体框架,没测出差别

阿简
阿简

· 阅读约 3 分钟

多智能体框架到底选哪个?

这个问题隔一阵就有人问一遍。框架也确实多,每个都说自己最顺手。答案更多,基本都是拍脑袋。这周终于有人不拍脑袋了。

八月十二号,arXiv 上挂了一篇论文。一个六人团队,把几个开源多智能体框架拉出来,认真比了一遍。

这期小抄只收这一条。不是这周没别的动静。是这一条把别的都衬成了背景音。

框架怎么选,之前的小抄里收过一次。那次只敢说一句:先挑一个用熟。这次有实证撑腰,可以多说几句。

他们怎么测的

两步走。

先做定量分析。看每个框架的文档、特性,还有开发者视角下的能力。再挑一部分框架,用同一个用例各实现一遍,做定性评估。

用例是给一个 HTTP 网址指向的文件做摘要。

就这么大点的事。我喜欢这个,后面单独说。

点评:这个测法本身值得抄。与其比较十个官网的首页,不如拿自己的一件小事,让每个候选框架各跑一遍。跑完心里就有数了,比谁的评价都准。

几个框架的 ROUGE 分数,没有显著差异

这是全文最值钱的一句。

ROUGE,简单说是给摘要质量打的一个分。同一个摘要任务,几个框架跑下来,分数拉不开。

每次出新框架,对比文就跟着来一波。那些对比文有个通病,基本没真跑过什么。这篇跑了。

所以这篇等于替所有人泼了盆冷水:至少摘要这类活,别吵了。差距不在框架,在你有没有把一个用下去。

也不全是。这里我得修正一下自己。

ROUGE 只量摘要质量。框架稳不稳、出错好不好查,这些它都量不出来。所以别把上面那句用成“闭眼选”。用到“够用”这个程度就好。

选型花两周,上手三天放弃,这种事我见得不少。真正拉开差距的是后面那半句。

基础组件都有,遥测缺

论文的另一个发现:所选框架对多智能体的基础组件,覆盖都不错。缺的是智能体遥测这类高级功能。

遥测的白话版:agent 干活的时候,留不留记录。出了问题,你能不能回头查它到底干了什么。

缺这个,说明这些框架都还年轻。也说明接下来一阵,各家会抢着补这一块。

顺带一提,论文把遥测归在“高级功能”里。我不同意。能查错是底线,不是加分项。

普通人选框架,暂时不用管这个。但自己搭 agent 的时候,记得留个记录的口子。你放给它的活越多,这个口子越值钱。

用例朴素这件事,本身值得说

回到那个用例。给一个网址里的文件做摘要。

这么小的一件事,写成了论文,还被期刊收了。《Empirical Software Engineering》,过了同行评审。

在一个满地都是观点文章的领域,这算稀罕。同行评审不等于一定对,但至少有人认真挑过毛病。看材料先看这一眼。

更重要的是,这个领域终于有人做笨功夫了。一件小事,几个框架,跑一遍,报个数。比又发布一个新框架值钱。

新框架这周也没少出。我一个都没收。等哪天有人像这样把它们拉出来跑一遍,再说。

没读完的部分

论文还有一段经验教训和挑战,帮人按自己的需求挑框架。

这部分我还没细读,先放在这里。读完了回来补一句。

本周就这些。

上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →