在 arXiv 上看到这个标题的时候,我第一反应是不太想点开。软件工程成本估算模型,每个月都来几篇,COCOMO 改良版、故事点重新定义,公式一堆,合上什么问题都没解决。
这篇 ACEM 我点开了,因为应用场景写着代理式软件工程——写代码的是 agent,人退到后面做计划、规范和验证。这个场景下成本基本靠感觉:跑之前心里没数,跑完看账单,贵了心疼一下,便宜了当运气。
读了几段,确定这篇值得推。它没拿 COCOMO II 或故事点硬套,直接说传统模型的成本驱动是人类劳动,代理式场景这一条不成立。总成本拆成三块——LLM 调用、人类监督、基础设施。拆法不算惊艳,但至少是在按 agent 实际花钱的方式分类,不是从劳动工时推出来的。
第 4 页还是第 5 页,两个概念让我确信作者自己跑过 agent、付过费。一个叫修订因子,专门建模输出被拒和重试带来的额外 token 开销。做过 agent 的人都知道,“不行你重新来”在账单上看不出痕迹,它跟正常调用混在一起,但一大笔钱就花在重试上。
另一个叫上下文因子:上下文越堆越多,token 消耗往后段猛涨。跑长任务的人都见过后半程的账比前半程吓人,光按“输入+输出”估根本兜不住。
这篇没法跑,只读了——模型结构里的常量全是符号形式,原话是「有待经验校准」。
偏偏是这句让我最有好感。SE 里大部分估算模型的问题,是尽早填个常数出来装严谨,然后那些常数根本没人真去验证。ACEM 把结构和校准分开,先收着,不急着给数。
不点链接也能带走的一句:给 agent 项目估成本,先忘了 COCOMO 那套人月思维,按“LLM 调用 + 人盯着 + 基础设施”三项拆,再用重试开销和上下文累积去修,比把所有人折算成工时靠谱。
