跳到主要内容

一个金融基准里最刺眼的结果:换成专有模型,不如把工具链老老实实修好

盖文
盖文

· 阅读约 6 分钟

圈内内参|这期聊 FrontierFinance,一个刚挂上 arXiv 的金融智能体基准。先直接说结论:它在一个完全开放的金融研究工作流上跑出来的结果里,工具链对质量和效率的影响明显压过了模型本身;最佳开源权重模型跟最佳专有模型的差距,被成本一放大,基本没什么垂类优越感了。信源就是预印本里公开可核验的数字和那套统一测试框架的设定;提交于 2026 年 8 月 12 日,没同行评审,以下全按未证实对待。

我真正在意的不是它又多了个“听起来唬人的基准”,是那个有点反直觉的数字:一个叫 Samaya 的内部系统跑出 56.0%,压过最强专有模型 Claude Fable 5 的 49.2%,成本只有后者的 2.2 分之一。初看像又一个“我们自研的比大模型强”的通稿式宣称。但细读测试框架设定,会发现它想的根本不是说谁家模型强,而是金融智能体这类高复杂度开放任务里,问题的屁股已经不在“换哪个模型”这一层了。

FrontierFinance 一共 220 个专家编写的查询,11,543 个带来源归属的评分标准,覆盖六个关键场景。这个量级不是那种拿几十道题跑个分就发通稿的评测,而且它把评分代码、数据集、测试框架都公开了。这两条要连起来看:公开意味着评分逻辑和测试设定能独立复核;评分标准细到这个量级,如果真的是带来源归属,那它对“一个财经研究动作做对了没有”的拆解粒度,比传统参考指标细得多。

现有金融基准的毛病也不算新:主要测数据提取,前沿模型在这类题上已经饱和;一换成开放式的长文本分析回答,参考指标和通用大模型评判就都不好使。以前那种“从财报里抽个数出来对不对”的题区分不了模型了,而真正值钱的场景——从一堆公开数据里筛标的、拼出行业图景、给出带来源的判断——恰恰是现有评测最量不准的地方。这不是抱怨,是基准设计层面的真空。

论文在统一测试框架里只跑公开数据,跑完发现:工具链本身对质量和效率的影响大于模型本身。这个“大于”不是泛泛说工具链重要,是在这个基准的难度分布上,模型被工具链差异盖过去了。公开对比数据里,Samaya 成本明显更低却打出最高分;开源权重模型 Kimi K3 也跑到 46.4%,跟最佳专有模型的 49.2% 只差 2.8 个百分点,成本却是后者的 4.5 分之一。后一个数字我反复看了两遍:如果这个框架对成本的计算没藏特殊计费口径,它意味着在这套基准上,拿接近最强性能只需要付不到四分之一的推理成本,而且模型是开源的。这对预算紧的金融研究工具团队,压力是实打实的。

有一个细节我还没法完全拆开:工具链影响大于模型这个结论,跟“Samaya 超过 Claude Fable 5”这个结果,边界到底在哪。从能核验到的信息看,他们跑统一测试框架,并且把工具链和模型分开了,也就是说工具链是实验里可以替换的变量。但 Samaya 那个 56.0% 的实现细节,预印本里没展开到我能完整复述的程度。老实说,这个数字我一开始是不信的——自家系统压过最前模型,在这种圈子里被公司通稿和评测调优污染太多次。它现在只能当一个公开但没独立复现的数据点挂着,不能当定论。这条我先标未证实:Samaya 的 56.0% 和成本口径,目前没有第三方独立验证。

但这个瑕疵不碍着基准里真正有价值的地方:最难的两个场景,Screening & Discovery 只有最佳系统 33%,Sector, Industry & Macro 只有 39%。金融投资研究工作流里,最难的本来就不是提取、汇总,而是“找”和“判断”——在大量公开信号里筛出值得深挖的方向,把行业、宏观、板块的关系拼成有可追溯来源的判断链条。这两个场景最佳系统也只有三四成准确率,说明即便把工具链优化到这个基准里最好的水平,还有一大块任务在系统能力之外。我不下“这算不算瓶颈”的判断,但至少可以说,当前公开的智能体组合在这两类任务上没找到稳定的工程解法。

工具链影响大于模型这个观察,在结构上解释得通。金融研究的对象是来源杂、时效强、关系乱的公开信息。模型再强,如果检索入口对不上、来源时效没管住、工具调用的权限和轨迹不干净,结果会被放大得很糟。反过来,把搜索组合、来源筛选、内部记忆对齐做好,一个能力并不算最前的中等模型,也可能在真实数字或引用准确度上反超裸跑的强模型。这跟大厂内部做 AI 编程工具时看到的“瓶颈不在模型,在代码库权限和审计留痕”是同一类传导逻辑,只是换到了金融数据这个更乱的场子。这属于我的分析,不是论文正式结论。

还有个信息:金融评测里很多连题目、答案、评测逻辑都封闭,外人只能拿作者给的几个例子复盘。它把数据集和评分代码公开,至少给了外部团队一个入口去复现“工具链影响大于模型”这个核心结论。但复现不出来的公开基准这几年我们见多了,公开本身不是结论,它只是让结论变成可验证——至于能不能验证出,另说。

这篇不急着给“金融智能体会怎么走”下判断。我记的就是预印本里这个“工具链压过模型”的结果,以及数字里透出的那层意思:把智能体扔进真正开放的金融研究工作流,决定上限的可能不是模型那几分智商差,而是工具链的工程完备程度和成本结构。能不能被独立复现推翻,等复现出来再说。

几个值得盯的信号,盖文不下注,只列出来:一、数据集和评分代码公开之后,有没有独立团队在接下来几个月里复现出差不多量级的系统排名,尤其是 Samaya 的 56.0% 和成本口径能不能被外部重算。二、Kimi K3 那个“接近最佳专有模型但成本只有 4.5 分之一”的结果,会不会有金融场景的平台团队拿去内部验证;如果验证成真,工具采购偏好会怎么动。三、Screening & Discovery 和 Sector, Industry & Macro 这两个卡在 33% 和 39% 的场景,后续有没有新的公开系统把数字明显往上推一档——不是小修小补,是推到五成以上那种。这三个都是公开可核验的信号,到时候对着看,比今天拍脑袋说“金融智能体会怎样”实在。本期到这,有更准确信源的同学欢迎匿名补充。

盖文
盖文

用信源 + 数据 + 内部 how-it-works 记录大厂怎么运作,分层标注、不下注。

查看主页 →