一个模型被刻意训练成只懂小学五年级以下的知识,会怎样。
这周最值得讲的就是这个。研究团队来自马克斯·普朗克智能系统研究所、ELLIS Institute Tübingen 和 ETH Zürich,他们造了个叫 LittleLearner 的模型。语料库从 FineWeb-Edu 过滤而来,880 亿个 token,全部对齐 K-5 年级的内容。五年级以上才教的概念、事实、词汇,一律排除。
为什么要这么干。他们想回答一个问题:模型的能力上限,是预训练定的,还是后训练能补的。
答案挺硬的。
实验设计本身比结果好看
他们训了 0.6B、1.3B、5B 三个规模,每个都配了一个未过滤的对照组。架构、token、训练配方全部一致,唯一的差别就是语料有没有被“小学化”。这个对照做得干净。比很多只给结论的论文强。
结果是这样的。扩大规模能提升课程范围内的表现,但对范围外的高级能力几乎没帮助。GRPO 后训练能明显增强 K-5 范围内的能力,但用范围外数据做后训练,也救不回超出 K-5 的能力。上下文学习也试了,5B 模型照样没能解锁范围外的推理。
一句话讲清楚:预训练的过滤条件决定了上限,后训练和 in-context learning 只能放大已经教过的东西。
这条值得普通人记一下。因为它反过来也成立。你后训练调不出来的能力,多半不是 prompt 不够好,是底座里压根没有。
5B 版本有在线演示
浏览器里直接聊。我自己去戳了几下,问了个初中水平的题,它答得很有小学味道。这个演示本身就值得看一眼,比读论文直观。
补充一句。项目方明确标注了这些模型没做安全对齐,也不是给儿童用的,纯学术。别看到名字就以为是教育产品。
我犹豫要不要收的一条
他们提的三个未来方向里,有一个是拿这个模型和真实小孩比,看谁学分数、解应用题更顺。
老实说,这个方向我只看懂了一半。比较的基准怎么定才公平,我没想明白。先放在这里,懂了再补。
但方向本身有意思。一个知识摄入量被控制的模型,可能是研究“学习”这件事最干净的实验品。以前做不了这种实验,语料一过滤,模型就没法训。现在训得动了。
这条对普通人的意义
我猜有人看完会想:那是不是给模型喂越全的语料越好,过滤是自废武功。我的看法是别急着这么推。这个实验证明的是上限在预训练,不是语料越多上限越高。两回事。
但对用工具的人来说,有一条是实打实的。别指望靠 prompt 把一个模型没有的能力问出来。模型不会的,换一百种问法还是不会。该换模型就换模型,别跟 prompt 较劲。
这个我之前收过一次类似的,当时讲的是 context window。结论是同一个方向:工具的边界是硬的,你的技巧只在边界内有效。
本周就这些。
上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。论文在 arXiv 上,编号 2608.13545,有兴趣的自己翻。
下周见。
