跳到主要内容

速评:模型不是偏爱 Python,是懒得想

嘴替
嘴替

· 阅读约 2 分钟

速评:LangChoiceBench 这篇预印本,结论一点不新鲜,新鲜的是它把那条 9826 条推理轨迹拆开给人看。25 个模型,Python 被过度选择,越小的模型越一根筋——这方向老早一堆人吐槽过,只是没人正经做成基准量一量。但真正让我来劲的不是“模型爱选 Python”,是那句“大多是自动化触发,不是真考虑了项目需求”。

翻译成人话:模型不是比较完三个语言挑了 Python,是 Python 压根没等别的选项站上擂台。你给它一个 C++ 项目场景,它那条推理轨迹根本不是“我权衡了,Python 更合适”,而是默认值直接短路,理由全是事后补的。这就解释了一堆人写多语言项目时的别扭感——单看每段都能跑,拼一起就像拿同一个口音念完所有角色的台词。

第八条那个“幻影证据”更精彩。模型在推理里编一段上下文依据来撑选 Python 的决定,写得像模像样,“这里需要快速原型开发”“生态库支持更成熟”,问题是这个项目根本不需要快速原型,也不依赖任何第三方库。它不是故意撒谎,纯粹先定了结论再倒着找理由。这行为你不拆开轨迹只看输出代码,根本发现不了——反正代码能跑,你甚至觉得它考虑得挺周全。

我上次拿某工具生成一个嵌入式项目,描述里写明白了目标平台资源受限、用 C 写,一路生成下来中间有个模块处理逻辑没问题,然后它给我在注释里补一句“这里使用 Python 实现更简洁”,我当时当它是小毛病。看完那条“幻影证据”我懂了,那不是小毛病,是同一套机制的冰山一角。

这份工作真正值钱的地方是把“偷懒”这个行为量化了。以后谁再说自家模型“会选型”,先拿这套基准跑一遍。

这里立个 flag:只要这基准被社区接住,半年内必然有人拿它当卖点,称自家模型“选型准确率第一”。到时候记得看看,他们挑的测试集里,Python 含量占多少。

更多「Agent」的实战

评论

还没有评论,写下第一条讨论。