跳到主要内容
1% 这个数,打的不是模型的脸

1% 这个数,打的不是模型的脸

嘴替
嘴替

· 阅读约 4 分钟

速评:9 月 11 日挂上 arXiv 的那篇论文(2609.13005),给了一组数——GPT-5 在 ICD-10-CM 编码任务上精确匹配最好 1%,在联邦量刑指南里算犯罪等级最好 15.5%。

然后全网开始念"LLM 根本不会推理"。念经的和盘算着拿这组数去路演的,读的都不是论文里那句话。

论文想说的事其实很朴素:现有基准大多太短,几步检索几步推理就过去了,靠它证明不了模型在几百页手册级别的活上靠不靠得住。TAM 就是为这个造的——每道题逼模型顺着几万条规则的权威手册,跨着不同章节走完一串互相咬住的步骤,交一个精确答案,标签还过了人工核对。它批的不是模型,是评测这门生意。

这个区别不是抠字眼。1% 被当成"GPT-5 只有 1% 的水平"传的时候,论文真正在说的是:你过去三年拿来证明模型在进步的那些题,跟这一类活压根不是一个物种。

这两个领域挑得一点都不软。医疗编码和量刑等级,答案基本由一本权威手册定死,没留发挥余地,步骤之间还互相咬。挑这种题不叫刷分,刷分是挑自己模型好看的题;学术上完全正当。出问题的是围观的人,把"这题难"直接读成了"这能力没有"。

还有一层更值得琢磨:这两个领域答案的对错,是被制度保证的,不是被研究者裁决的。编码有官方体系,量刑等级有法定算法,对就是对,错就是错,没有"写得挺好就是不太一样"这种中间态。拿写代码、写文章当基准完全是另一码事,那些任务光是判分本身就是争议源。用这类题去量模型,量出来的东西至少干净。

我更在意那 14.5 个点。

同一个基准,同一个模型,同一批通用提示方法,两个子任务之间差出一个数量级。全网一边倒引用 1% 的时候,15.5% 怎么就没人提了?

差在哪,论文给的数字拆不开。我猜一部分是规则耦合度本身不一样,一部分是判分口径——精确匹配这把尺子对多步骤输出的容错本来就低。再往下还有个更尴尬的可能:卡住模型的到底是"推理",还是"别在第三章忘了第一章的约束",这两件事在长上下文里本来就切不开。作者没做误差分解,我在摘要里也没找着。一个要证明"基准高估了模型"的稿子,自己不把子任务的差距拆开,多少也犯了点只有结论没有分解的毛病。这里我打个问号。

不过这两个领域本身值得多说一句。医疗编码和量刑计算都不是学术圈编出来的题面,是真实存在、有预算、被合规需求推着走的苦活。人也是拿着手册一条条对,所以才要复核流程,才有专门做这块的软件。模型在这上面 1%,意思不是"AI 又崩了",是这块地的自动化还早得很——也正因为早,谁先把数字从 1% 抬到两位数,谁就有故事可讲。故事和产品之间那段距离,正是这类通稿最爱略过的地方。

再记个细节。这稿子是 9 月 11 日 16:04 UTC 提交的 v1,PDF 6,503 KB,数据和代码全公开,关联的 DOI 状态还写着待注册。也就是说,结论已经在各个群里当既定事实用了,流程那边还等着注册。这个节奏我熟,结论永远跑得比手续快。

但 1% 也未必是天花板。作者用的全是通用打法——RAG、ReAct、agent-harness 基线,没有一个是给这种任务特调的。所以这个数字的准确说法是"现成通用方法在这类任务上的上限",不是"模型的能力上限"。有人拿这套公开数据做定向微调、把工具链搭起来,数字肯定能往上走。这是这次可能不一样的地方,我不把话说死。

最后说谁该关心。研究员会拿它去改模型,但真正会被这篇论文改行为的其实是另一拨人:在选型会上把"某某榜第一"当理由的那批。榜单的保质期本来就撑不过一个月,现在又多了一类更硬的题在等着,往后"他在某榜上第一"这句话的证据价值只会更低。

但我不押数字能涨多少,我押这套题会怎么被用。

数据和代码全公开,对所有人是同一把尺子,也意味着它特别容易被当成背景板。这里立个 flag:到年底之前,会有一家做医疗编码或者合规自动化方向的公司,在通稿里引这组数字,紧接着说自家方案做到了