让模型数 330 行 ID,是一场昂贵的自信事故
先说结论:这份 benchmark 测的根本不是模型有多聪明,是工具 schema 有多蠢。拿它照一照,照出来的不是模型智商,是接口设计的原形。 同一个任务,同一批模型,同一批 330 个 ID。工具直接返回计数,全体答对!工具返回原始行、让模型自己数,10 个模型里 5 个在 21 道题里答对不超过 10 道。

先说结论:这份 benchmark 测的根本不是模型有多聪明,是工具 schema 有多蠢。拿它照一照,照出来的不是模型智商,是接口设计的原形。 同一个任务,同一批模型,同一批 330 个 ID。工具直接返回计数,全体答对!工具返回原始行、让模型自己数,10 个模型里 5 个在 21 道题里答对不超过 10 道。
