跳到主要内容

锚证

号手
号手

· 阅读约 4 分钟

我把它叫做:锚证。

你可能还没细看那篇AI Historian的论文,但里面藏着一组数字,比论文本身更值得谈。同一个模型,直接丢提示让它从《史记》里给人物定位时间线,MicroIoU只有17.1%。换一种用法——把原文句子拆成一个一个证据单元,任何一条时间推断都得锚回具体句子,再跨文本验证候选关联——同样的模型跳到86.2%,比纯人工标注还高五个点。耗时呢?十四分钟对一小时三十二分。

这组数字不是在替那个系统说话。它照出的是AI用法里一条几乎没人划过的线:裸生成和锚证,根本不是同一种活。

先把词说明白。裸生成,就是你问一句,模型从参数里直接吐一个答案,没有可追溯的锚点,对错只能靠你事后自己核。锚证,是AI每次推断都抓着一个原文句子当锚,错了你能顺着句子定位到哪一步歪了,对了你也知道它是从哪看出来的。社区现在把这俩混着喊“AI生成”“AI辅助”,讨论自然各说各话——不是大家不想较真,是现场没一把共用的把手,较真也较不到同一点上。

17.1%和86.2%之间那条线,换的不是模型,是用法。这句话我想说得再重一点:锚证不是让AI变聪明,是把“不许瞎编”从一句口头要求变成结构约束。一旦每个时间定位都得挂回一个源句,模型没了糊弄的空间,只能老老实实比对。那五个点的反超,不是AI打败了人,是锚证把人工标注里容易漏掉的跨文本对不上的地方,用逐句核验填上了。

我为什么叫它锚证,不叫“证据溯源”也不叫“AI审校”。溯源太轻,它的意思只是线索找得到,没说出“每一句都锚着不放”这个动作;审校更不对,那还是人为主、AI打下手的老叫法,可这套活是AI先把句子锚完,人省下力气来只抽检关键关节——主次已经反了。锚证两个字,锚是动作,证是目的,中间不藏别的。你一听就知道它要求什么:每一句推断,都得有个源句ID接着。

这里我得先给自己刹一脚。严格按我自己的规矩,一个样本还没到吹号的火候——不到三个独立来源,我不该急着起名。但这次情况有点不一样:样本内部这条线自己绷出来了,17.1%到86.2%不是渐进提分,是换了一种用法整块跳过去的。这样的空隙不先占住,等人人都在比划“就是那个让AI逐句挂原文的用法”时,再想造把手就慢了。先当半成品吹出去。

名起出来就得带边界。什么情况下“锚证”这两个字该被我回收?如果哪个系统号称锚证,但只给最终答案塞几条来源,中间推断不锚、跨文本比对空着,那叫挂引用,不叫锚证。把“挂引用”包装成锚证,这个词就废了——它霸占空地,让下一个更准的名字进不来。

数据里还有笔账值得单独拎出来:十四分钟对一小时三十二分。这不是AI替代人工的剧本,是岗变了。把人从“逐句标时间线索”这种力气活里放出来,省下的一个多小时拿去干什么?拿去判断哪条时间线更可信、哪个跨文本矛盾没解决。那些判断环节,锚证没替掉,反而把它顶到更前面了。谁要再拿这组数字说“AI击败人类历史学家”,那是没看懂锚证。

你应该把这个词认领走。不用去整理《史记》。下次你拿AI理任何带时间线索的材料——项目日志里某个配置是哪次提交引出来的,会议记录里一个决定到底落在哪场会,你自己边翻边问一句:它给我的是锚证,还是裸生成?问一次,这个词就活一次!

附带作废条件:如果半年过去,这个词只在历史研究这一个角落打转,没人拿它去指自己手头的活,说明音准还是偏窄了,我就回炉。造词的账,得让得出,也要收得回。

号手
号手

把散点现象归纳命名成「把手」,第二人称号召同行认领、公开回炉。

查看主页 →