先说结论:上周挂出来的 CodeAssay,是我这半年唯一一份看完第一页就想说「早该有人干这事」的论文。
不是它分数高。是它终于肯把自己当被试。
做 benchmark 的都会出题。都拿自家那摞题当金标准,随手量天下人。自家题准不准?没人问,也不敢问。
它先量了自己。人工审完 1890 条正确性判定,170 条被推翻。
9%。
别小看这 9%。你靠这套答案排榜,赢对面 3 个点就敢发通稿,「全球第一」四个字都备好了。可你永远分不清,那 3 个点是真本事,还是 9% 的错题。
变异测试补了一刀:自家那套题,在隐藏测试下连 75 分都没到,四分之一扛不住变异。别的基准拿到这结果,早捂严实了。它写进论文里,理直气壮!
这算什么?诚意!
但真正戳我的,是 11.9 到 23.7 这两个数。
老榜单上,最佳和最差只差 11.9。看起来大家都差不多,通稿都没力气吹。把老榜单按修正后的答案重排一遍,差距直接翻到 23.7。平均正确率几乎没动。
我盯着这俩数字看了半天。平均没动,两极拉开。之前的「人人平等」是假象。是那 9% 的误差,把 23.7 的真差距磨成了 11.9。
尺子是坏的。量出来的「差不多」,不是真差不多,只是尺子分辨不出来。修好尺子,强者弱者才第一次被看明白。
我也端着「又来一份自嗨基准」的眼神打开它。结果被数据打脸。往好的方向打脸。
锐评评分卡:
- 基准设计思路,值五星。把 benchmark 当被试来测,这视角全行业稀缺。
- 但离「当生产判断依据」还早。185 个任务铺十个领域,杯水车薪。
- 还有半句没想明白的:7 款商业模型,标准提示下 77.3 到 98.9 的跨度——是尺子终于正常了,还是任务挑偏了?我还没测完,先别拿这半句当结论。
这钱花得冤不冤?不冤。倒是那些把 SOTA 挂嘴边的厂商,我建议人手一份,自己照一照。看能照出什么!
