PCFBench 这篇论文真正值钱的,不是「模型准确率还不够高」这句废话。它把一件更麻烦的事摆台面上了:AI 现在做碳足迹估算,撑死算个草稿水平,离签章还差得远。而碳足迹这个数,恰恰是未来几年里少数几个会变成「法律责任」的 AI 输出。代码错了还能修,碳数据错了,账本上记的是钱,而且不是你一家企业的钱。现在市面上一堆「AI 颠覆 ESG 咨询」的融资故事,等这个基准的细节传开,有一部分要开始还债了。
先算笔账。四家供应商、八个前沿模型,端到端估算单个产品排放量,最好的那个能在约 77% 的产品上把误差控制在「不超过公布值两倍」以内。听着还行?换个方式让它分步生成——先把产品拆成环节、再逐项计算——这个比例直接掉到 37% 到 58%。同一个模型、同一道题,换成更「可审计」的工作方式,它一半以上的活儿干砸了。为什么?因为碳足迹不是「最后数对就行」的活。中间每一步都在记账,错误是复利式的,差一点,到后面滚成一大块。你让它一步到位出总排放量,它靠的是统计模式匹配,说白了是猜答案;你让它分步来,每一步都要推理、要查数据、要对齐口径,它就开始露馅。
PCFBench 把任务切成了信息检索、数据拆分、本体匹配、数值提取这些环节,单个环节单独测都还凑合,组合起来跑,没有一个模型能扛住所有环节。最狠的是质量守恒那条,只有 45% 到 75% 的通过率。这条我得单独说说——相当于让 AI 算账,算完账不平,借方不等于贷方,它照样敢把数交给你。碳足迹是个物理量,物理量的本质是守恒。输入的水、电、原料,跟输出的排放、废料、中间产物对不上,这数就是废纸。八个模型里最好的也就四分之三能过守恒这道坎,差一点的四成多就翻车。你以为你在用 AI 提高效率,其实有一半时间拿到的是「差不多先生」编出来的数。
往深算一层,商业后果比技术指标严重得多。碳足迹现在是合规工具,很快会变成定价工具。欧盟 CBAM 已经在算钱了,供应链碳披露从大厂往中小供应商传导,也就是这几年的事。今天你用 AI 估出来的总排放数,明天可能出现在一份有法律效力的报告里,被审计师、被客户、被海关翻来覆去地核。论文自己也点了一句,性能不足会削弱透明度,进而影响产品比较和脱碳行动。翻译成账本:一个不可信的碳数据,会让你在欧洲客户面前丢掉报价资格,或者让你在碳关税里多交一笔本可以争回来的钱。这不是「模型准确率」能覆盖的,这是「你敢不敢用 AI 替你签名字」的问题。
谁在赚这笔钱?第一波赚到的,是卖「AI 碳核算方案」的创业公司。它们讲的故事没错——手动碳核算太贵,一个咨询顾问一天的成本就够买一年软件订阅,AI 能把人力压到十分之一。错在它们把「能输出一个数」直接当成了「能交差」。基准没出来之前,大家都拿端到端的总量对比说事,77% 的产品在两倍误差内,拿去融资做 demo 够用了。但客户真要拿这个数过合规审计,分步生成那 37% 到 58% 就原形毕露。第一波人赚的是信息差的钱——客户不知道分步生成会差这么多,投资人也不知道,账本上先记着营收,合规风险这栏先空着。这种赚钱方式不可耻,但窗口期短,基准一出,信息差就开始抹平。
第二波赚到钱的是模型厂商自己。评测显示没有任何单一模型在所有任务上占绝对优势,这句话的潜台词是:你现在选谁家的模型,本质都是「各有各的坑」。这话对模型厂商反而是好消息——客户没法一家通吃,就得同时试好几家,试错成本本身就是营收。更妙的是,「都不太行」给了它们继续迭代的理由。API 按 token 计费,你跑一次碳足迹任务,分步生成要调十几个子任务,token 消耗是端到端的五倍不止,模型厂躺着赚。你的碳数据靠不靠谱,不关它的事。
第三波最安静也最稳,是做「AI 估算 + 人工复核」工作流的团队。这帮人不吹 AI 替代人,卖的是「AI 先跑一遍,人把关键环节再审一遍」。看着没技术含量,但账算得过来——碳核算咨询按小时、按人天定价,AI 把初期数据收集和初步估算的成本压下来,人把精力集中在「哪几个环节模型容易翻车」的审校上。基准没出来之前,这类团队说自己「有经验知道哪里会错」,听着像敝帚自珍;现在基准把「哪里会错」给量化了,他们的服务反而更好卖。不是 AI 干不了,是 AI 能干一部分,剩下一部分得有人兜底,而兜底的那部分刚好是值钱的那部分。
这笔账我一开始算的时候站在「AI 碳核算很快能用」那边,后来发现自己漏算了一项。碳足迹不是「生成式任务」,是「负责性任务」。生成式任务出错,你笑一笑再换一次,成本可以忽略;负责性任务出错,你要花十倍的人力去查错、去解释、去补报。而 AI 在负责性任务上的错误模式跟生成式完全是两码事:它不会告诉你它不知道,它会给你一个看着特别精确、特别像样的数,然后这个数可能连质量守恒都过不了。最烧钱的地方就在这——不是它错得多离谱,而是错得看起来很对。你没法一眼看穿,等看穿的时候,报告已经交了。
那怎么办?能走的路其实就两条。第一条,把分步生成当作唯一的工作流。别再用端到端出一条总数的方式做任何正经的碳核算。分步生成虽然烂,但烂得可定位,哪个环节错了能在中间抓出来;端到端是「不可定位的错」,给了你一个数,你根本不知道哪里出问题。一个能被审计的错误,在过合规的场景里,价值远大于一个无法追踪的总数。这条路上没有爽点数,但它能把风险从「我不知道哪里会炸」变成「我知道它可能在这三个环节炸」,雇人补的时候知道该补哪里,账算得过来。
第二条,认清定位——AI 在做的是初筛,不是出具。初筛是拿它把几百个产品、几千个 SKU 先过一遍,挑出「看着离谱」的出来人工算,剩下「看着合理」的顺手确认。这个用法不需要模型多准,需要它「错的方向稳定」,分步生成加质量守恒校验正好能把这件事做到一个及格线。别指望 AI 给你出带法律效应的碳足迹报告,那个阶段还没到,可能三五年内都不到。这段时间能做的,是把 AI 塞进工作流,让它干最累的查数据、提取数值的活,把签字的权力留在人手里。
说句不好听但必须说的:市面上那些号称「一键生成碳足迹报告」的产品,卖的不是软件,是免责幻觉。客户觉得买了软件就合规了,软件公司觉得交付了一个「能出数」的功能就完事了,两头都默契地没提「这个数能不能经得起审计」。等第一个因为 AI 估算错误被 CBAM 罚钱的案例出来,市场会迅速洗牌——不是技术洗牌,是责任归属洗牌。谁能把「AI 输出的数据谁负责」写进合同,谁的生意就能往下走;谁还在含糊,谁就是在给未来的官司攒材料。
记到账本上:PCFBench 这个基准,把碳足迹 AI 从「能不能用」这个伪命题,推到了「出了错谁买单」这个真问题。前一个阶段讲故事就能拿钱,后一个阶段你得把风险条款写清楚。窗口期正在关闭,但关的方式不是「AI 突然不能用了」,而是「客户突然开始问你能签多少保底准确率」。答不上来的,出局。这笔账,你自己算。
