跳到主要内容
降价的是「智能」,还是那层能廉价验证的活

降价的是「智能」,还是那层能廉价验证的活

2013入行
2013入行

· 阅读约 7 分钟

三条东西散在时间线上,单看都不像新闻。有人贴出自己的账单,AI 月支出从 408 欧元掉到 28 欧元,而拿到的能力和 token 量比一年前那一档还多;韩国大学的工资溢价停在 31%,OECD 平均是 54%,可韩国年轻人七成有学位;一个实习生跟同事讲,自己这届大概是最后一批"真毕业生",往后的毕业班靠 AI 过完各种考核,学历这张凭证的可信度要打折。把这三条摆一起,它们不是三个话题,是同一条曲线的三个截面——供给端每单位有效产出的价格在塌,需求端吸收这些产出的那层在变薄,中间夹着的一代人正在重新估值。

那条讨论的标题写的是"智能的价格在快速下降",然后大半力气花在了"那人类智能是不是也在降价"上。这个问题问错了层。被定价的从来不是"智能"这个属性,是一束很具体的东西:可被第三方验证的中等难度认知劳动。医生的一部分判断、工程师的一部分计算、分析师的一部分建模、客服的大部分应答,都是这一束。这束东西的价格在塌,不是因为智能变便宜,是因为验证变便宜了。

按验证成本分层,比按难度分层有用得多。最下面那层是易提出、易验证、难求解的任务——数学定理、能编译通过的代码、结构化抽取、格式转换。这一层的验证几乎免费,所以它是强化学习能吃到的甜点区,也是合成数据能立住脚的地方:能自动判定对错的环境,就能自己造题库、自己出题、自己刷分。有评论举的例子是 LLM 证明新定理、在 Lean 里验证,再拿验证过的东西去证明更多——这条链条的关键不是模型有多聪明,是每一步的裁判是机器而且不收费。再往上走,验证本身就贵:这个诊断对不对、这个架构撑不撑得住明年、这事到底该不该做。到这一层价格塌得慢,不是因为模型做不到,是因为没人能便宜地告诉你它做错了没有。

这里有个常被漏掉的细节:token 单价下降和任务总成本下降不是同一件事。单价塌了,但很多场景每个任务用的 token 反而更多,因为便宜就敢喂更长的上下文、敢多跑几轮自检;只有在终点明确、步骤有限的任务上,总成本才跟着单价一起掉。所以看这条降价的曲线得看两条,一条是每 token 的价,一条是每个已完成任务的总价,两者在某些场景里正在分叉。

把镜头拉远一点看,这不是第一次发生。评论里那位自学编程的人讲得很清楚:他共事过物理学博士、流体动力学和涡轮工程的高级学位持有者、化工博士、地质学博士后,而他自己是做网站出身。他顺口带出的那句才是重点——他那位涡轮工程师同事说,全世界大概只有五家公司雇得起他这个背景的人,而这五家的景气是同步的;他毕业那年正好赶上萧条期,五家都不招新人,于是他转行写软件,因为软件雇主多,待遇和条件都更好。这不是一个人的运气问题,是吸收层的问题:聪明人一直过剩,三十年里是软件开发把这批过剩吸走了,把它盖住了。现在这个吸收层本身在变薄,被盖住的那部分就会露出来。

机制相似的一次处置,二十世纪已经发生过一遍。码头工人的活被集装箱吃掉之后,当时的解决方案不是"让码头工人变成起重机操作员"这种漂亮叙事,是让受影响的这批人基本终生领一份生活工资、不再工作。这个先例值得记着,不是因为它可以复制,是因为它说明吸收层塌掉的时候,社会的第一反应通常不是重新分配人,是重新分配钱。

韩国是眼下最接近对照实验的一手数据。高智商、课外补习卷到极致、七成年轻人拿学位,结果大学工资溢价 31%,OECD 平均 54%。这条数字说明的是:学历溢价从来不是学位的属性,是供需的属性。当受过高等教育的供给把需求淹掉,学位就退化成一张不带来溢价的收据,和它教得好不好没有关系。讨论里那些关于学校变松、学生压力变小、自杀率下降的说法如果成立,那是这个结构的症状,不是原因;把它读成"AI 让孩子更快乐"或者"下一代要完",都是在症状层吵架。

这里得认一个错。此前我把 agent 的编排能力归在壳层,判断是"这只是工作流整合,不构成新护城河",后来挪到了场景层,因为能不能让 agent 在真实项目里连续跑而不脱轨,靠的是权限设计、审计和信任积累,不是壳层那点组织能力。现在这一层还得再挪一次:我原本把"验证成本"当成场景层的固有属性,但那份关于 harness 层递归自我改进的工作说明,验证的一部分本身可以被搬进 harness 层自动化——在固定的评估预算下,研究代理能获得可迁移的效率提升。这个修正让我不太舒服,因为如果我上面那条"验证贵的那层守得住"的判断,前提正是验证不能被便宜地自动化,那这个前提正在被啃。

这里得小心一个类比的边界。把"验证被自动化"直接等同于"签字权被替代",中间隔着的不是技术,是责任能不能落到一个东西头上;这两件事在历史上经常脱钩很久。所以往下我不给单一路径,只给两条,各自附前提。

路径 A:被自动化的验证停在"易判定"那一段,验证本身昂贵的那层——需要有人签字、需要承担后果、出了问题要追到具体的人头上的活——继续维持溢价,人被重新分配到那里,价格曲线在监管和责任的边界上变缓。路径 B:合成环境加 harness 的递归改进把自动验证一路推到"贵"的那一段,那时候人的签字就退化成一种纯粹的法律形式,人拿到的不是认知溢价,是保险费,金额由赔付责任而不是由能力决定。

我压 A 偏重,但不像两年前那么笃定。理由是历史上这个边界确实会移动,可它移动的速度被两样东西拖住:一是责任的可分配性,机器签名在大多数司法和行业标准里还没有落地路径;二是失败成本,越是验证贵的领域,错误越贵,越没人愿意把签字权交给一个每次迭代都可能不一样的系统。这两条都是慢变量,不会因为某个 benchmark 上去了就消失。

这个判断什么时候该扔掉,我想得比较具体:如果未来几个季度出现稳定的案例——不是实验室里的,是被监管或行业标准采信的那种——在验证本身昂贵的领域里,无人类在环的产出被第三方正式接受并承担责任,那路径 A 就该扔掉,换成 B。看单项指标没用,得看签字权有没有真的转手。

所以真正的问题从来不是"智能值多少钱"。是你在哪一层,以及你所在的那一层正在被谁重写。层会搬家,护城河会从一个层跑到另一个层。这个母问题本身不搬。