跳到主要内容
同一批回答,换裁判差了十二个点

同一批回答,换裁判差了十二个点

2013入行
2013入行

· 阅读约 8 分钟

九月十二号挂上 arXiv 的 PAI-Bench,到今天满打满算十天。按我给自己定的规矩,十天前的东西通常不够格单独成篇,单帧画不出曲线,等它跟另外两三帧接得上再写也不迟。这次破例,理由是这个东西不算一条新闻,算一套协议;协议不会在十天里挥发,而且我手里已经有另外两帧能跟它接上。

先把这篇干的事压成一句:Zhenyu Zhao 和 Roy Zhao 造了一个跟厂商无关的基准,量一个 agent 对自己那份“身份契约”的忠实程度;契约可以被版本化,可以被更新规则改写,量的是执行得准不准,不是记不记得住。两个工程取舍单独拎出来:打分用的裁判不放在被测进程里;整套评测拆成互不替代的几个轴——recall、composition、behavioral enactment、resistance、persistence、lineage、role-conditioned updates。两个冻结 campaign,十六份合成画像、三十二根探针、三套彼此独立初始化的目标配置,最后留下 1536 条回答。样本薄,作者自己认了,单条件只有一个目标样本,靠事后审计和追加追问补。27 页里 18 页是附录,图只有两张,这个配比已经把力气花在哪儿说清楚了:不在正文叙事,在审计表里。期刊分类主挂 cs.AI,交叉挂 cs.MA,说明作者自己也是按多 agent 问题在想,不是按单模型行为问题。

论文里最像“发现”的是 48/48 和 1/48:原子式提问里,直接父级标识符四十八条全中;换成隐式自画像,四十八条里只剩一条。作者把结论写在标题上,Identity Is More Than Recall。这个结论没错,但它有注意力的代价:一篇基准论文最容易被记住的往往是标题那句话,而这句话把目光引向目标模型那一侧——“别只量回忆,要量身份”。我更在意另外两组数,它们的落点都不在模型那边。

一组是钩子的灵敏度。同样四句话的指令,八个画像上把字段提示写明白,三个身份标识符联合出现的比例从 0/8 抬到 7/8;换一组实验,只把开头的身份标签替换掉,完整称谓的出现率从 1/8 到 7/8,而父级标识符照旧缺席。翻译一下:同一个 agent 这一轮“是谁”,很大程度上不由它内部存了什么决定,由这轮怎么问决定;不同身份成分对钩子的敏感度还不一样,有的成分一拨就动,有的怎么拨都不动,还有的成分只报大名、不认爹。这不是能力问题,是提问面(prompt surface)的结构问题。真要把身份做进产品,要设计的是问法,不是容量。

另一组是复现实验。把完全相同的 factorial 回答重放一遍,换一个裁判打分,Claude 那边的头条均值比 Astra 低了 12.5 个百分点。同一批素材,同一套题面,只换裁判,结论挪了十二个半点。作者把这个设计单拎出来,就是为了把评测者敏感性和被测目标的行为分开;我认为这篇论文真正的重量级数字是这个,不是标题里那个。

十二点五个百分点是什么量级,同行都清楚。这个行业能为了三五点的 benchmark 差距吵一个季度,写十几篇稿,改一次产品定位。现在有人告诉你那把尺子本身抖十二个点,而且是在“同一批回答”这个最干净的条件下抖的。这不是打脸哪家厂商,这是把尺子这一侧从“下游工具”重新放回棋盘上。

把镜头拉远一点。能力侧基准和真实交付之间的相关性一直在掉,这件事我前面写过不止一次:多数生产场景早就过了“模型不够聪明”那道门槛,剩下的分歧在成本、在集成深度、在跟具体工作流的贴合度上;榜单还在更新,但它对采购决策的解释力在衰减,撑着的主要是叙事。这个判断成立的话,直接推论是——模型层比较越来越拉不开,比较的重心必然往别处搬,搬到“怎么定义合格”这件事上。谁能定义合格,谁就在议价上多占一层。

于是身份基准的落点浮出来:它看着在量 agent,其实在量“合格的 agent 长什么样”这个定义的执行成本。

按惯用的三层棋盘放一放。底下模型层,出原始推理能力;中间壳层,把裸模型包成能用的工作流;上面场景层,开发者每天真在那儿干活、习惯在那儿被锁住。评测这件事过去挂哪一层?严格说挂模型层,因为评测对象是模型,买单的也是模型厂商,第三方基准的活是把模型能力翻译成一个可比的数字。身份契约这套东西不一样:版本化、更新规则、角色条件化的更新,这些词指向的不是一次推理的质量,而是一份跨会话的状态治理协议;裁判不在被测进程里,输入是长期存续的契约,输出是“这一轮有没有守约”。它站的位置更靠近场景层,是买方和部署方要写进自己流程里的那层东西,不是厂商的营销物料。

先认个错。我此前一直把这类记忆/身份能力当成壳层的一个功能项在记账,跟补全质量、上下文窗口、检索效率放在同一栏里比长短。这个分法错了,而且错得比看起来严重:功能项可以被下一代模型顺手吃掉,契约不行。契约带更新规则,更新规则带治理权,治理权带的是买方流程里的位置,它比功能项沉,沉得多。格子归错,那几篇连带的判断方向也跟着偏,当时还给自己找理由说“不就是个 memory 功能”。这条记下。

历史模式这一层,机制的骨架不是第一次出现:买方没法直接验证质量的时候,会去买“验证”本身;一旦某个协议被写进采购流程,它的护城河就不再是准确度,而是“改用另一套协议意味着要重新解释过去所有决策记录”这层沉没成本。评级、审计、认证都走过这条路,先是公共服务,然后变成事实上的准入门槛,然后开始有租金,而且结构性地偏向大玩家,因为只有大玩家付得起合规成本。这个类比我不打算推到底,中间有几步明显不成立——AI 评测的价格量级和强制力都远不及传统认证体系——但骨架是同一根。

那会走到哪去。我给三条。

评测留在公共品位置:协议中立、学术维护、便宜、谁都能用,谁也不靠它挣钱。成立前提是采购侧继续把评测当一个勾选项,没有哪家买方愿意为它单独付钱。

被采购侧收编:一到两套协议变成企业交易里事实上的必要条件,协议所有者拿到一个安静的租金位置,然后按评级机构的脾气行事,慢、保守、偏爱在位者,因为只有在位者付得起合规。成立前提是买方开始把评测结果写进合同条款,而不只是写进 PPT。

被平台吸收:模型厂商自己发评测工具链,契约面顺手做进自家 harness,“中立”退化成平台的一个功能项,独立评测悄悄死掉。这条路我们在别的层位见过一遍了,壳层就是这么被模型层吃过一轮的。

我压二和三的混合,而且压得比较重:企业那一段走二,长尾和开发者自用那一段走三,中立协议活下来,但退成少数参照点,不是主流采购依据。这个判断的扳手不在技术,在一条很具体的分界线上——买方能不能拿到原始回答,能不能自己重放。

拿不到原始素材、只能买一个分数,分数就是产品,价格由卖方定,路径二和三都会加速;拿得到 1536 条那种级别的原始记录、能自己拿去重放,分数就退化成可验证的公共品,一和二的边界要重新划。这篇论文真正值得学的不是那些戏剧性的 0/8 到 7/8,是它把裁判放在被测进程之外这个架构决定,因为它让“重放”在技术上成立。技术上成立和商业上守得住是两件事,不能混着说。

最后给证伪条件。如果接下来两三个季度里,同一条线路上出现的新实验把裁判之间的分歧压进个位数百分点、比如三点以内,那“评测者自己构成一层、自己有独立的经济学”这套论断基本作废,它退化成一个工程细节,上面这张分层图和这次压注都得重画。我押它压不下去,理由是从公开可查的几个复现实验看,分歧不是随机噪声,方向是稳定的。但这里我有前科:同类判断上方向对过几次,仓位都下得偏轻,所以这次把话说得比平时更直一点。