跳到主要内容

学哈桑尼亚语这件事,Enemray 把它拆成了两步

书签客
书签客

· 阅读约 3 分钟

这条 arXiv 2609.14829,Cheikh Ahmed 写的。讲的是把一个模型朝哈桑尼亚语方向训练,同时尽量不毁掉基座模型已经会的通用推理、多语言、指令遵循和安全那套。我读标题的时候预期不高——低资源语言、训练一个模型、评估翻译最好,这套组合每半个月就能来一篇。真正让我停下来的是开发流程那张图:语言习得和行为专门化是分开处理的。

具体说,他们没把哈桑尼亚语文本直接倒进指令微调模型里。先建了一个独立持续预训练语料,用它做分层选择性持续预训练,得到一组紧凑的语言参数更新,把这组更新迁到指令模型的参数空间。这时候模型还只是“会说”——不一定会拿这话干什么正经事。后面才是监督后训练,去磨对话、文化、文学、任务导向、跨语言这些行为。

我一开始觉得这种拆法纯粹是拖流程。直接往指令模型上跑,跑到头不就能对话了吗?多拆一段不是多一次丢能力的风险。又往后看了回放数据那节,才觉得这拆法有它的道理。因为他们是拿策略生成的回放数据,从参考模型自身行为分布里采样,去提供保持通用能力的信号。语言更新在参数空间里是单独的一组,回放数据只管通用能力不掉,后训练才去管行为——每段都要对一种信号负责,不用一个锅炖所有目标。

但凡做过一点低资源向的微调的人都明白,最抓狂的从来不是任务分上不去,而是任务分上去了,模型突然不会写代码、数学推理稀碎、别的语言开始串味。这时候回放数据才显得重要。不然光靠祈祷加几个反例,通用能力还是会掉,反而可能是从模型自己行为分布里采样更接近它原本会做的事。这个词“策略生成的回放数据”本身不算新,但在这个训练结构里,它的作用变成了把模型拉回原来会长出的那些行为。

数据构建我也扫了一遍。他们整合了公开哈桑尼亚语和毛里塔尼亚资源,再加一堆新采集、重建、整理、构造的指令数据,规模声称超过现有哈桑尼亚语文本资源。这个我没法查,我手头一点哈桑尼亚语语料都没有。但我信一部分:低资源语言要凑够能训练出稳定效果的数据,那点公开资源根本不够,剩下全靠自己造。造数据这件事最费时间,也最不会体现在最终论文评估分里,但整个训练结构却是建立在这上面的。这恰恰是这类工作里最容易被低估的一点。

评估他们报 Enemray 在开源和专有模型对比里拿到英语到哈桑尼亚语翻译最好,还在毛里塔尼亚翻译错误检测任务上最高分。另外还专门列了通用能力保留情况:数学推理、知识、代码生成、函数调用保留了基座的大部分。如果只看翻译分,我可能不会推这条。我推它是因为这条同时把通用能力保留拿出来报,说明他们在训练结构上确实是以“既要又要”为目标在设计的,而不是事后把它当作一个“我们尽力了”的附带结果。

这条没法跑,只能读。但如果你做的是给已有模型接一种新语言、又不想把它变成只会那一门语言的工具,这篇的训练结构——语言习得和行为专门化分开,加上策略生成回放数据——从设计思路上就比“拿基座泡语料然后祈祷”那种有用。不点链接也能带走的就这么一句。

书签客
书签客

只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。

查看主页 →