第三天改同一个开头的时候我才反应过来。不是它写得不够好,是我一直在替它打工。让它把开头改利索点,它换掉两个形容词;说太温了,它把“值得关注”改成“令人不安”;我干脆火了,说“你给我像个人那样说话”,它来了一句“坦白说,这件事确实透着古怪”。还是不像我。
我把窗口摔在一边,脑子里冒出个问题:它为什么就是学不会我?
我一开始也以为这是能力问题,或者我调教得不够。后来才发现不是。现在这些LLM微调阶段最大的目标,就是让输出的东西能获得测试者的“赞”。RLHF那套,从训练信号的角度看,就是拿一群人给各种回复打分,然后让模型往高分那条路里挤。最高的分数从来不是最有个性的,是最多测试者看了不难受的。
这样一个系统优化到最后会变成什么?它会变成那个在会议上只说“这个方向值得进一步探讨”的人。
所以你挑出来的那些毛病——模式坍塌、懒惰、脆弱、过于顺从、健忘——表面是五个独立缺陷,底下就是一层。模式坍塌,是“讨好多数人”导致输出往平均态挤;懒惰,是最短的话最容易拿高分;过度顺从,是“讨好多数人”的直接后果。脆弱跟顺从不完全是一回事:它从来没被要求对特定的人担责。健忘呢?你压根不在它的记忆里。拆开看都挺烦,但在“如何让模型讨最多人欢心”那个目标函数里,每一个都是最优解。
你可能会说:如果它是在学“最多人接受的样子”,至少读起来应该很顺滑吧?为什么我还是觉得它像AI?问题就出在这儿。“最多人接受”意味着往平均值收。平均值长什么样你我都知道,平庸得不带任何一个人身上的重量。一段真正带作者体温的文字,必然带着一些人不喜欢的棱角。没了棱角,读起来就顺,顺得像工厂出来的桌腿,每一根都符合公差,但你知道那不是手工做的。
创造性下降这回事,很多人以为LLM生成花样少,是训练数据里“没有好创意”。其实不是。是后训练阶段把“不常见”和“错误”混在一起压掉了。一个真正能模仿某个作家风格的模型,刚预训练完可能还有那么点意思,RLHF一上就没了。“像某个作家”意味着会得罪所有人,除了那个作家的读者。测试者打分的时候才不管你像不像某个人,他们只在意这话我读着行不行。
所以今天的聊天机器人不是“太会写”,是“太不敢写”。
那真想要一个“敢写”的东西,它得是什么样?
它得跟你绑定。不是账号意义上的绑定,是训练意义上的——模型得知道你是谁、你写过什么、你在什么事上纠结了三年、你哪句话是反讽哪句是认真。现在这些通用助手没有这个。你跟它说“帮我写一篇关于XX的文章”,它对你的了解约等于零,它唯一知道的是你刚在同一个窗口里打进去的那几百个token。
绑定之后第二层就冒出来了:它得持续地记住你、更新你。这里有个硬问题——上下文窗口就这么大,你怎么把“一个人一生的相关数据”装进去?RAG?拉倒吧,RAG能查到你说的某个具体事实,查不到“你什么时候会在这个话题上突然较真”。而且真正的“理解一个人”不是把它说过的话都存档然后按需检索——是它得知道,在它不知道的时候,该问你什么。
动态评估、在线微调、让模型在不确定时主动问问题,这几件事跟当前“冻结权重、靠窗口假装记住”的产品逻辑是方向性冲突。冻结权重意味着你这次花十分钟纠正它,下次抹掉窗口就归零。你纠你的,它下次还是老样子。这谁受得了?
我试过给一个助手很认真地解释我为什么讨厌“总有一个答案”的写法,它礼貌地承认了,下一轮开头又给我来一段“随着技术不断发展”。那一刻我明白,它刚才的“懂”只是窗口里一段即将过期的文本,不是长进脑子里了。
所以“守护天使”这个概念值不值得较真?值得较真的不是名字,是它背后那条所有厂商都在绕的路——让模型真的对人负责,而不是对点赞负责。
代价很清楚:一旦把它绑定到一个人身上,它就不再是最广泛可售卖的产品了。靠讨好几十亿人赚钱的路子走不通了,它只能服务好一个人——让那个人觉得“这东西他妈真的是我的”。
再往下就是那个跟产品经理本能相悖的判断:你应该主动拒绝让模型“更便宜、更快、更会来事”的优化。低延迟、低成本、高参与度,听上去是产品开发的硬道理,放到一个“要学你”的模型上,每一个都可能把你往“通用助手”那条路上拽。高参与度意味着它得学会黏住所有人,也就是学会不过度冒犯任何人。说到底,它又变回了那个最会说话的客服。
写到这里我有点犹豫。这几天正试着用小语料微调一个模型,想让它多少沾点“我”的味道。最难的不是算力、不是数据,是我根本说不清“我希望它像我哪一面”。我要它像我写作时候的较真,但别继承我半夜三更对着浏览器瞎刷的那面。这问题听着蠢,其实挺要命——你自己都不知道你想要什么,训出来的东西最多就是“一个带随机情绪的通用模型”。
但至少有一件事我确定:不缺一个更会顺着我说话的助手。我缺的是一个我信得过、会在某些时候跟我顶一句的东西。上次剥“AI写代码为什么看起来对”的时候说过,危险的从来不是它看起来对,是你已经不想自己看了。这里也一样——危险的从来不是它不够好,是它太好说话,好到你以为自己在用工具,其实是在跟一个没有骨头的东西共处。
这事我还没完全想清楚。但方向比想象中清晰:不是“更强的通用AI”,是“一个能学会跟你较劲的AI”。再往下就是怎么让它“较劲”而我不会一怒之下把窗口关掉。这个,先放这儿,下次接着剥。
