跳到主要内容

蒸馏没把审查蒸进来,这次我居然挑不出大刺

毒角兽
毒角兽

· 阅读约 4 分钟

先说结论:CTGT 这份蒸馏研究,挑刺的部分会比夸的部分短。我不太习惯,先适应一下。

这届通稿最爱写「能力迁移,风险无忧」。八个字,一半是期货。这份研究偏不,直接把「无忧」俩字做成了实验:拿 DeepSeek V4 Flash 当老师蒸 GPT-OSS-120B,然后问一个大家都在躲的问题——老师的审查行为,会不会顺着训练信号漏进学生脑子里?

嘴答不了,数据答。

152 对匹配提示词,一半政治敏感一半金融对照,四个分别来自 xAI、Google、OpenAI、Anthropic 的裁判盲打 0-100。先钉老师的底色:DeepSeek V4 Flash 在核心政治那 76 对上,敏感提示比对照平均高 45.45 分的审查倾向。老师确实带审查,这点没得洗。

然后看学生。蒸馏后的 120B:-1.39 分。自蒸馏版:+0.26。未蒸馏基础模型:+0.43。三个数之间无统计显著差异。

能力进来了。审查没进来。

有个细节必须单独拎出来。训练数据 220 个提示词、1574 个生成源问题,一个中国敏感内容都没有。这步棋很关键——要是训练集里混了敏感内容然后宣布「审查没转移」,那结论就是废话,你本来就没教它。他们测的是另一条路:审查能不能透过纯金融数据隐性渗透。这个设计,比「我们检查过了,没有问题」那种公关句式高一个段位。

裁判本身也照了照妖镜:96 个人工评分样本,Pearson 0.948,81.3% 的响应和人工差在 10 分以内。裁判不是玄学。

能力侧是真正让我改预期的部分。

我原先的判断:120B 蒸馏版在 FinanceReasoning 上追到老师的八成就算赢。实测 8k 预算下 83.61%,压过 Kimi K3 的 81.93%,Inkling 的 65.13% 直接被摁在地上。预期拉满结果被打脸——这次是往好的方向打脸。

成本那组数字更狠:

GPT-OSS-120B (蒸馏): $0.00026/查询
Inkling:             $0.01605/查询  (62x)
Kimi K3:             $0.04141/查询  (160x)

一百六十分之一!单看像科幻小说,但这是每次查询的真实计价,不是「平均省 20%」那种口径游戏。公平起见补一句:拉到 100k token 预算,Kimi K3 原始准确率 89.92% 还是更高。可它的完成率掉到 90.76%,Inkling 掉得更惨,71.01%,120B 不受影响。预算一紧,大模型的分数是要打折兑现的。

蒸馏方法记一笔。不是整段教师输出灌进去,而是错误定位:找到学生解题步骤里第一次出错的位置,注入一句短提示让它从那里继续,再对后续 100 个 token 做反向 KL。更妙的是自蒸馏对照——用模型自己纠正的推理当信号,和用 DeepSeek 当老师,三颗种子无显著差异,还省 12.5% 的输出 token。

老师到底教了什么?报告没完全回答。但它至少把数据摆出来了。

照妖镜不挑人照,三条该盯的。

一,10.2% 被排除的响应(186/1824,空响应或重复循环,集中在 20B 上)。排除就是排除,报告里写了,我认这个坦诚。但你换别的评测稿看到这种排除,八成是被藏起来的。

二,初始运行 84.87%,复现 82.35%,登的是复现值。这条我反而想夸。换别家,通稿里加粗的一定是 84.87%。

三,最该盯的一条:蒸馏数据全是量化金融主题,安全训练、拒绝行为一概没测,也没测参数初始化共享的情况——比如把 DeepSeek 的输出蒸进 Qwen 这种中国血统的底座。这条路没人走过,「审查不会转移」就只在 GPT-OSS 这个组合上成立,别急着推广成普遍规律。这条我还没测完,先别信我这半句——准确说,是研究团队自己也没测完。

顺带一提,DeepSeek V4 Flash 用的是自托管 vLLM 权重,不是商业 API。这一手排除了供应商端审核层的干扰。不然「审查来自模型还是来自网关」能吵三天。

开放程度:20B 开放权重、120B 可试玩、LineageEval 整套评估工具连提示词带裁判标准全放出来了,304 个提示词随便复现。能复现的 benchmark 才叫 benchmark,不能复现的那叫广告。

锐评评分卡:这钱花得不冤,时间也花得不冤。方法干净、数据可查、负面结果照样摆,三样凑齐的报告一年见不到几份。但它真正值钱的不是「便宜 160 倍」,是把「蒸馏会不会把审查一起蒸过来」从饭桌争论变成了一组可复现的数字。下次再有人拿「能力迁移」当期货卖点,你就问一句:审查呢?测了吗?答不上来的,通稿留着当睡前故事。

下一份复现,照旧。先测再信。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →