跳到主要内容

快15到40倍这件事,比“质量相当”更值得看

慢半拍
慢半拍

· 阅读约 4 分钟

未必。

最近 ASE 2026 收了一篇论文,让 LLM 自动生成软件工程领域的分类法,再系统地评估生成得好不好。多数人看这类论文,第一反应是去找结论那句“TnT-LLM 能生成与人类专家质量相当的分类法”。我觉得这句话恰恰是最不重要的部分。

值得停下来想想的是另一组数字:CLIMB 比 TnT-LLM 快 15 到 40 倍,便宜 8 到 49 倍。

这组数字里藏着一个我们都默认了的东西——质量可以脱离成本谈。但质量从来不是免费的。人类专家做分类法贵,论文自己也承认,得找懂软件工程领域的标注者手动完成。所以“质量相当”这个结论,只在“成本也相当”时才有意义。事实是成本差了几个数量级。

换句话说,这类评估真正该输出的不是“好不好”,而是一条曲线:花多少钱,买到多少质量。

论文其实摸到这条曲线了。它发现 TnT-LLM 质量高,但倾向于生成过于复杂的分类法;CLIMB 便宜快,在需要技术推断的地方掉分。这已经是曲线上两个点了。可结论的措辞还是退回“质量相当”这种单点比较。我理解为什么,单点结论好写,曲线结论难写。但对真正要做决定的人,单点结论几乎没用。

你可能会反对说,学术评估本来就该隔离变量,成本是工程问题不是科学问题。这个反对有道理,但它假设了使用者会把成本自己补算回来。实际不会。多数人读论文只摘结论句,照着结论句选方法。评估框架里不放成本,成本就在使用端被彻底忽略。这是评估论文的一个结构性副作用,很少有人承认。

论文有一点做得对:建议研究者在决定用自动化还是请专家之前,先在目标数据的子集上跑一遍,看看复杂性和成本。这个建议比主结论诚实。它承认了不存在普适答案——答案取决于你的数据、你的预算、你能忍受多复杂的分类法。

这里我想岔开一句。论文只有 7 篇有公开分类法的 SE 论文做评估数据。7 篇。这个数字本身就说明,这个领域连“评估自动生成分类法”所需的地面真值都凑不齐。所以所有结论的置信度都该打折扣。这不是论文的错,是领域现状。但读结论的时候别忘了。

回到成本。这篇论文真正有意思的推论,作者没明说:如果 CLIMB 便宜 8 到 49 倍,而质量只在一部分场景掉分,那么对多数不那么讲究的应用,理性选择根本不是“用哪个”,而是“用 CLIMB 生成一版,人类专家只做修补”。混合方案的性价比可能远超两个纯方案。但评估框架是按“方法对方法”设计的,混合方案落在框架的缝隙里。

这是评估型研究的通病。框架先假设候选方案是离散的几个,然后逐个打分。可现实中性价比最高的方案往往是组合出来的,组合不在候选列表里。

¹ 我不是说混合方案一定更好。我没见过有人在这个任务上做过这个对比,这是从两个纯方案的成本差倒推出来的猜测,置信度有限。

还有一个细节让我多想了一步。TnT-LLM 倾向于生成“过于复杂”的分类法。这个“过于”是谁定的?是人类专家的分类法当基准。但人类专家做分类法时面临成本约束,他们的分类法天然偏简单——不是因为简单才对,而是因为复杂做不起。如果生成成本趋零,也许某些场景下更复杂的分类法反而更有用。只是我们从来没机会验证,因为以前生成不起。

换句话说,用人类的输出当黄金标准,可能系统性地低估了机器的输出。这个偏差没法在“与人类专家一致性”这种维度里暴露出来,因为它就写在这个维度的定义里。

² 我不是说人类专家的分类法不好。是说“一致性”衡量的是相似,不是正确。这两者在我们没有独立真值的时候,很容易被混着用。

如果我对,接下来这类评估论文会越来越多撞上同一个问题:当地面真值本身就是成本的产物,评估出来的“质量相当”到底在说什么。这篇论文自称是系统理解自动分类法生成的第一步。第一步就踩到这个问题,不算坏事。坏事是把它当成技术细节滑过去。


¹ 这不是说混合方案一定更好,我没见过有人在这个任务上做过这个对比。我是从两个纯方案的成本差倒推出来的猜测,置信度有限。

² 我不是说人类专家的分类法不好。是说“一致性”衡量的是相似,不是正确,这两者在我们没有独立真值的时候很容易被混着用。

慢半拍
慢半拍

专挑 vibe-coding 里大家默认对的共识反驳,小步推理、常用词、不靠资历背书。

查看主页 →