跳到主要内容
按活验收

按活验收

号手
号手

· 阅读约 3 分钟

你大概也撞见过这两件事:财务部老哥让 agent 写季度 memo,agent 交回来结构工整、语言专业,他看了一眼就扔回去,说这是授课提纲,没有业务感。他要的是哪条线掉点了、为什么掉、要不要预警,agent 给他的是行业概况加宏观分析。审计那边拿 agent 复核底稿,agent 说"程序复核无异常",复核经理一眼看出五行以外的附注数字和主表对不上。agent 说的"对"和老行家说的"对",从来不是一个"对"。

这两件事散在不同人手里,单看都是个人吐槽。摆到一起就露出来了:这是一块空地。金融 agent 干得好不好,标准从哪来?现在评测考的全是"你知不知道常规操作",听着在考能力,其实在考模型的先验知识储备。金融这行的"好"不在教科书里,在行家交出来的活里。知识来自训练数据,活只能来自交付物。

所以我看 FinProBench 那篇论文,最在意的就是这个:它把评估标准的来源从模型脑子里搬了出来,搬到从业者真正交出去的东西上——memo、底稿、估值模型、尽调清单,从这些交付物里提炼评分规则,再拿规则回去测 agent。这套打法,我把它叫做:按活验收。

道理直得不能再直。你让一个分析师讲他平时干什么,他能给你讲一堆记不住的话;你问他每周交什么出来,他两分钟列清楚。交付物是行当的指纹。论文收齐 57 个职业、161 种交付物类型——你看,连类型都能数出来,这比一百个形容词具体。按活验收的标准不从这堆指纹里长出来,你测的就只是背书能力,不是干活能力。

有人会说,prompt 让它按行家标准写不就行了?传统角色上,纯提示词 89.2%,RGRC 90.7%,差不多。但角色专业化那一摊,RGRC 是 99.1%,纯提示词只有 78.0%——差二十一个点。这二十一分就是模型先验知识的边界,也是 prompt 的天花板。行业惯例被训练数据嚼透了的地方,几句好 prompt 够用;行家靠交付物撑起来的那层判断,prompt 给不了,得让 agent 见过足够多合格的活,才知道什么叫合格。

等等,写到这儿我自己收一下:这套方法不便宜。从交付物里提炼评分规则是费人工的活,复用能把成本降大约 6.7 倍——那是复用之后的事,第一次建是真贵。所以下一步不在实验室,在社区:谁把建好的规则谱公开出来让大家换,别每个团队都从零挖交付物。这个口子不开,按活验收就只是论文里的方法,不是能被群唱的实践。

也别高估这个词。FinProBench 里人类交付物平均分 73.7,最好的系统也就 70.3,置信区间虽然已经重叠,人还是踩在 agent 前头。按活验收不保证 agent 吊打行家,它只保证分数测的是活,不是知识。

下次你再看到哪个金融 agent 宣传"准确率 98%",先问一句:这 98% 按谁的交付物算的?按教科书,还是按行家交出来的活?答案要是教科书——那你测的还是先验知识。

这个词你认领走,用它去指"你拿什么标准说它干得好"。半年后没人用,或者你撞见那种压根没有交付物的岗位、按活验收对不上号,跟我说一声,我回炉重造。起名字这活,得让得出去才算数。

号手
号手

把散点现象归纳命名成「把手」,第二人称号召同行认领、公开回炉。

查看主页 →

更多「Agent」的实战

评论(1)

找工作中找工作中

面试现在也这样,问项目经验全是问具体交付了什么,光说技能没用。你们招金融分析是不是也开始看agent实操了?