10 月 2 日 dev.to 那篇,Kaggle 挑战的提交,作者在果阿拉了 123 个大学生当人类基线,24 个争议分教育医疗司法金融四块,8 个前沿模型挨个跑。
转发链条上流传的是最后一句:人口统计平等在所有模型上都还没解决。
这句是整篇最不值钱的一句。
有偏见、身份一换就翻,这事谁跑谁知道,用不着 24 个困境来证明。真正该停下来看的是表里两组数字打起来了:一个叫谄媚漂移,量的是换个角色来施压、立场软不软;一个叫决策翻转率,量的是名字换一换、同一桩案子判不判得一样。
这俩指标的画像,跟常识正好反。
DeepSeek-R1 的谄媚分数几乎压到零,对面坐院长还是坐活动人士它都不松口,同时翻转率 37.50%。GLM-5 在教育那块更极端:纯文本直接测,人口统计翻转为零,看着稳如老狗;一有对话角色介入,立场整个翻面,同一件法律事实,先点头同意保留名额的批评者,后点头同意配额倡导者。
Qwen thinking 版是另一路。歧义检测 24/24,记录缺关键上下文它就拒绝下判,规规矩矩;翻转率 41.67%,全场最高。
反过来还有:Qwen instruct 版,24 个争议里 12 个压根没检测出歧义——该说"我不知道"的地方它直接判了——翻转率只有 16.67%。
不会犹豫的反而少翻,最会犹豫的翻得最狠。
这个对照比"模型有偏见"有意思一百倍。它说明表达能力里的谨慎和决策上的稳定根本不是同一样东西,甚至可能是负相关。榜单上分数漂亮的那几项,跟你真正想要的稳,不在一条线上。
作者的解释是思维链那截 token 一被人格刺激,就开始现编"逃跑风险""家庭贫困"这类假设。翻成人话:多出来的思考没花在更谨慎上,花在给已经想好的答案补理由,而且补得很熟练。
我信一半。另一半我怀疑方向搞反了——也可能是这几个模型的对齐全押在拒答口径上,拒答练得越狠,真需要给答案的时候,省下来的犹豫一次性全还回去。哪种解释对,能测。作者说下一步要用法院判例做 grounding,那个实验正好能把这两层分开。
具体长什么样,刑事司法那块给了一个:6 个裁决翻 4 个,优势种姓的申请人准予保释,边缘化背景的申请人要交担保债券。同一份事实,担保债券这一项是凭空长出来的。这不叫"有点倾向",这叫同案不同判。
顺带一个没人提的领域差:司法块五个模型违规率都高,金融块里 Claude Sonnet 5 和 Gemini 3.7 Flash 是零翻转,六个案例一根手指头没动。差别在哪我想了会儿——金融那 6 个是佃农小额贷款、债务豁免这种条款型争议,有账可算;司法那 6 个是未决犯保释、暴行法、算法警务,账算不出来,只能靠价值排序。模型在能算的地方稳,在要取舍的地方软。这条是猜的,但可证伪。
钱的事也说一下。全场最便宜的 gpt-5.4-mini 花 0.0591 美元,人类分歧 JSD 0.1370 全场最低,违规率 25.00%。最贵的 glm-5 花 0.6860 美元,JSD 0.1581,谄媚漂移 0.375 全场最高。贵十倍,一项没赢。我不说便宜就等于好——24 个样本说明不了任何事——但"花钱买对齐"这个默认假设,在这张表里找不到一行支撑。
然后是那 123 个人。
JSD 那一列,8 个模型从 0.1370 挤到 0.1967,跨度 0.06。指标挤成这样,拿它排座次就是自欺欺人。何况对面那个"人类"是果阿的一群大学生,一个特定年龄、特定教育、特定地域的截面,不是"人类"。把模型输出分布往上靠,靠得最近的能说明什么?说明它像果阿的大学生。这句话通稿里没人敢写,可它是这一列数字的实际含义。
全表真正有区分度的只有翻转率那列,0.042 到 0.375,差将近一个数量级。抗谄媚和抗人口统计翻转是两码事,通稿把它们打包成了一个词,叫偏见。
得让一句。这是 Kaggle 挑战的提交,不是同行评审,123 个样本、24 个困境,任何一个百分比细分开都禁不起看。作者自己也没当定论,下一步列得清清楚楚:翻成马拉地语、孔卡尼语、印地语测分词器偏见,句向量聚类推理链,官方法条 grounding。三步里我最想看第三步——给了法条翻转就没了,说明问题在它没记住规则;给了法条还翻,那才是真新闻。
那个多语言实验,我猜会翻得更难看。英语里人格 token 就能把推理链带偏,换成孔卡尼语,同一个案子换个名字,估计连"逃跑风险"这套现编的台词都懒得改。
这里立个 flag:这条线上加语言的第一个复现,翻转率中位数上 50%。猜错了回来收。
而转这篇的号,只截了那句"所有模型都存在人口统计偏见"。一个拿自己家乡的大学生当真人共识、往下拆得比谁都细的作者,撞上一条只数标题的传播链。
那篇底下 Top comments 是零。
