Jensen 在 X 上发那条祝贺的时候,我正蹲在值班室等一个灰度批次跑完。手机震了一下,同行群里有人转截图,配一句"AGI 来了,咱可以下班了"。
我回了个"嗯"。
不是不服。是这剧本我看过。二十年前那版叫平台化,十年前叫云原生,每次都有人出来宣布那件事已经来了,剩下的人该干嘛还得干嘛。换皮而已。
后半夜告警没响。那张截图倒是在群里挂了一整天,兴奋、好奇、恐惧轮着来,最后还是落到那个老问题:写代码的是不是要没了,CS 还用不用念。
有条说法挺清醒——从"模型能力涨了"直接推到"开发者要淘汰",中间少了好几级台阶。我同意。但那不是我最关心的。
我最关心的是那张成绩单。过不了几天,它就会出现在某个会议室里,被人打开、放大、拿去当报销凭证。
写系统卡的和念 PPT 的,从来不是同一拨人。
先说条常识,但这条每次都得重讲:基准分不是能力,是仪表读数。温度计量的是水银柱长度,不是你身上几度。
平时这区别不重要。什么时候重要?到有人拿着温度计给你量体温、然后决定要不要给你动手术的时候。
Astra 的系统卡我翻过。里面有一段生物评估——让模型预测不同 AAV 衣壳在包装上的表现,拿这个当"更广泛的生物设计能力"的代理。衣壳是什么我不展开,不是我的活。
代理指标这玩意儿的毛病,是它自己不会喊疼。那批当参考的原始预测要是本身就带着误差和假设,后面几代模型练得再熟,也只是把前人那套错法复现得更漂亮,湿实验室里的活一点没长进。系统卡里也写了,更新的那批评估开始用没发表的实验数据和湿实验室的验证结果,往真实世界靠。
这条我看了两遍。
不是因为懂病毒,是这个形状太熟——指标一挂上去,人就开始优化指标,不优化那件事。缓存命中率、SLO 达成率、单测覆盖率,哪个没被这么玩过。只不过这回被优化的不是人,是模型。看数的还是那批人。
几处细节也得拎出来。
评分器一动,分数就不可比。数据集、提示、评分口径、工具、模型设置,随便哪个换一下,那串数字就不是同一件东西了。系统卡里自己也承认,旧的结果别直接拿去跟新的比。可那张 PPT 上,没人标这个。
开放式评估里,长回答更容易撞上评分条件——所以人家专门报了个长度调整后的分数。这句话我读出两层意思。一层是他们知道有这个口子;另一层是,你上周引用的那个百分比,是调整前的还是调整后的?问出来,大概率没人答得上。
多个强模型在同一个基准上一起逼近满分的时候,这个基准就废了。系统卡里写得很清楚:旧评估会饱和、会退休、会被新的替换掉。这不是谁的测试失败,是到了需要新区分手段的时候。
问题是,退休的是评估,留下来的是那个数字。数字进了 PPT,脚注留在系统卡第几十页。
再往下就简单了,也是我最想说的那句。
基准分要是真能变成砍人的依据,那砍完之后,半夜接电话的还是原来那帮冤种。模型不接电话。它连"这个告警要不要紧"都判断不准,你让它替你值班?
这条逻辑链其实很短:能力涨了→提效了→可以少几个人→砍掉。中间缺的那一环是——涨的那部分能力,落在谁身上、以什么形式落地。省下来的活归写代码的,背的锅归值班的。这个剧本我看过,不打算再看一遍。
评论区有人提某个大网红自己搭了个模型就把 ChatGPT 比下去了。八卦我不评价,但它侧面说明跑分这门槛比大家想的低。扯远了,回到分数。
那我自己怎么办。两条,都是实际在做的,不保证对。
第一条,看到百分比先追问四件事:它到底量的是什么;这个测试现在还有多难(接近满分那种就不用看了);真值是谁定的、签字的是谁;评测设置上个月动过没有。四个里有两个答不上来,这个数我就当零处理。
审计这事评论区有人讲得比我清楚——模型、任务集、框架、工具、评分器、评分规则、结果,全得记下来,让比较这件事可解释、可复盘。这套我们内部已经在做。做的时候才发现,以前很多"对比"根本对不上口径。
第二条更土:别拿公开榜单上的胜负替自己做决定。挑 20 到 30 个你手头真实的活——不是"写个快排"那种,是需求写得半清不楚、数据脏、老接口还对不上号的那种——挨个跑一遍。看代码能不能直接用、需求理解到不到位、改起来返不返工、错了能不能自己绕回来、花了多少时间和 token。
上个月我就在干这个。表长这样:
model A 公开基准 68%
model B 公开基准 71%
真实任务:A 能用、B 能用一半、第三个两个都不能用
B 分数高,活儿干得糙。公开榜上看不出来。
评论区还有个更狠的做法:多智能体搭一套编码测试框架,验证器在干净代码检出上重跑每一项任务,把团队自己的活变成可执行契约——先让它在旧代码上必然失败,再要求在改完之后通过。失败在前、通过在后,这个顺序不能反。比我手搓表格靠谱,我已经在抄。
绕回开头。
Astra 发布那天宣布 AGI 到了,我没跟着激动,也没跟着慌。去看一眼它的评测是怎么被设计、怎么被替换的,比争论它是不是 AGI 有用得多。计算机科学从来不等于写代码,这话我不打算替谁论证;反正我认识的最能扛事的几个人,一大半时间不在写代码——在看需求、在改架构、在拦一次不该上的变更。
本期教训:别人递过来的温度计可以看,别拿它给自己量体温,更别拿它决定谁该被裁。
——尤其那个数,连长度调整过没有都还没问清楚的时候。
