跳到主要内容

速评:tokenizer 这门玄学,终于有人正经做度量了

嘴替
嘴替

· 阅读约 6 分钟

速评:TokEval 这篇,我看了两遍,第一遍想挑刺,第二遍想挑没挑成。COLM 2026 上的这篇东西,可能是今年 tokenizer 方向最有分量的一次尝试。

先说它做了什么。Clara Meister 这篇挂在 arXiv 上的论文,把 tokenizer 的评估从"看着顺不顺眼"往"能测"的方向推了一大步。这套框架提供了一组超出传统的 fertility、compression rate 之外的指标——UTF-8 字符边界完整性、数字的位值边界对齐,诸如此类。名字起得克制,叫 TokEval,不叫"重新定义 tokenizer",就冲这个命名,我觉得写论文的人是做事的。

我要真挑,先看 0.80 这个数。论文说信息论指标预测语言建模性能,Spearman rho 最高 0.80。这个数字好看,但聪明人就该问了:预测什么?predict 后面跟的是 bits-per-byte,不是下游任务表现。语言建模性能和下游任务表现这俩之间,隔着十万八千里的 context length、SFT、RLHF。拿 0.80 出来当卖点,确实把故事讲得漂亮,但一口气吹到位容易闪着腰。

不过——这篇论文最扎实的地方在那里?控制变量预训练。她真去跑了对照组实验,只改 tokenizer 的训练数据混合、预切分策略、训练算法,其他不动。这不是嘴上说"tokenizer 很重要所以你们要重视",是把模型训出来拿 bits-per-byte 和 benchmark 摆一起比。这套做下来贵,但做完之后的结论别人没法嘴硬。"tokenizer 设计直接影响模型能力"这件事,她不是用推理证明的,是用 GPU 烧出来的。

然后就是我打问号的地方。论文说结构敏感指标——digit、换行处理的那些——跟任务准确率相关。相关。注意这个词。他们没有说"因果",就一句"correlate"。这边训练成本这么高,控制变量做都做了,怎么到结构指标这儿就收了?我猜这里头有个不太好讲的原因:结构指标和任务表现之间的关系,可能不如信息论指标那么稳定。要是真的全都扎扎实实,按这篇文章的调性,不会是"相关"这个词一带而过。所以这里我打一个问号,不是质疑结果造假,是怀疑他们把最关键的一层捅破了又糊上,留给读者自己品。

那句"两处一致的地方"是最后的护城河。我不觉得这是缺陷——换我我也会写进 abstract 里——但你细想这句话的贪心:它把"全部替代预训练扫参"这个野心,用一个非常优雅的转身删掉了。不承诺你在任何地方都能替代,只说"在一致的地方"替你省钱。以后谁拿这个工具没测准,那一定是不在"一致的地方"。完美的退路。

回头说说指标本身。Fertility 和 compression rate 这套老演员确实该退休了,但它们至少是稳定的——测一次,全世界同结果。TokEval 那组新指标听着唬人,digit place-value boundary 这种,选哪些属性本身就是一种主观判断。你选对了,指标就好用;你选漏了,那测了个寂寞。这跟传统指标比,多了一层"谁定的标准"的问题。不过也得说句公道话:任何评估框架都有这层,不过是大家平时假装看不见,这篇论文至少把指标定义写成了可复现的库,别人查得着。

这剧本,眼熟。前几年 embedding 评估火过一次,也是先有人做框架,再过半年圈里人手一个 favorite metric,再过一年发现各说各话,最后死了几条,大家又开始看回那两三套老基准。TokEval 现在就走在这条路的起点上。做框架不稀奇,稀奇的是她给框架配了受控预训练实验——这就把"我的指标有效"从"我觉得"升级成了"我验证过"。这条护城河看起来不大,但挡得住一整代的跟风者。

结构上这篇论文还有一点让我觉得舒服:她没把 benchmark 当免死金牌。做数学推理、代码生成、语言理解几个方向都测了,汇报方式也算规矩——不是那种"我们指标全面超越"的浮夸图,curve 摆那儿,好就好看,坏就坏看。在 2026 年这种"只要敢喊就没有不敢发"的环境里,这种正常做作业的态度反而稀罕。倒不是说它没有可骂的地方。用信息论指标去预测模型能力,理论上限就摆在那:模型训练是几十个变量缠在一起的过程,你拿一个维度的指标去推整体表现。这跟用 SAT 成绩预测一个人的人生成就一样,相关是有的,但你要真拿它当升学唯一标准,迟早出事。所以我认为 TokEval 应该当"第一道筛子"用——跑一遍跑出大问题,那后面别浪费 GPU 了;跑出来漂亮,再去跑真正的预训练。

看这篇的推送时机也有意思。挑在 8 月 18 号挂 arXiv,赶在 COLM 之前。这个时间点卡的——不是月底也不是假期,学术界注意力最集中。而且 COLM 是这两年 LLM 圈人最多的地方,选这家当首发,明显就是冲着让整个 tokenizer 研究方向的人都看到来的。"tokenizer 测量"这个方向要站起来了,这篇是给这个方向立的旗。

我自己的坦诚时刻:过去我也试过用 tokenizer 的文本统计去"猜"模型表现,试了三次,翻车三次。看了这篇才明白我当时哪里不对——拿 fertility 当单兵用,没有把结构维度的东西放进去。所以我看到 TokEval 的那组指标时是有私心的:早一年出来,我就能少烧那三笔钱。这么想就不太忍心把它骂得太狠。

结尾不遮着:论文的叙事确实是精心设计过的。从"tokenizer 没被系统评估"这个行业共识切入,祭出"信息论指标能省预训练成本"这个谁都眼馋的钩子,再用 0.80 和受控实验双重担保,最后用一句"在一致的地方替代"给自己留好退路。这一整套下来,说它研究做得好,不如说它话术也做得极好——从选测量属性到选发布时点,全都对。

但我不觉得玩弄叙事有什么问题。好工作是"说人话、给出路、有验证"——这篇三条都占了,就算把那个 0.80 打个七折,剩下的也足够让整个 field 重新想"tokenizer 怎么选"这个问题。这里立个 flag:半年之内,TokenEval 会出现在至少十篇 tokenizer 相关论文的 baseline 表里——有的用,有的踩,但没人能假装它不存在。