跳到主要内容

十道题定终身,这剧本我真见过

嘴替
嘴替

· 阅读约 2 分钟

速评:十道题,图一乐可以,拿来定终身,这剧本,眼熟。

这作者做的事我认——本地题库加抽卡生成当测试集,跑在 Jetson Nano 上,翻车 OOM 了还自己加 swap file 接着干。能把这些写进评测里不遮着,说明是真在跑,不是抄榜单。

可问题恰恰出在这个"十"字上。十个 OSI 模型的问答题,测出来 qwen2.5:3b 全精度档位 100% 正确,llama3.2:3b 在 q4 以上也是 90%,数字光看着当然漂亮。这能说明什么?说明这十个题它都会。至于会不会泛化到用户真实会问的上千种问题——不,不代表。评论区那几位也看出来了:没有延迟、没有内存占用、没管 context window 多长、Jetson 这种小设备跑久了必降频也没测。就一个准确率孤零零地摆着。

我举个自己踩过的坑。去年拿五个"逻辑推理"题测一个新模型,五个全对,我差点把它焊死在我的 agent 管道里。结果扔了个多轮对话进去,它从第二轮起开始用中文回答我的英文 prompt,不对题。五道题全对,一到真实场景就出原形。从那以后我看 benchmark 先看题量,再看出题人是不是拿脚出的。

当然,这次可能不一样。作者出题很克制,拿 OSI 模型固定那套东西考,属于稳定输出范围,不是故意刁钻的脑筋急转弯。而且他的场景——本地生成测验题——就是这种固定格式的中低难度任务,正好是 3B 小模型擅长的区间。qwen2.5:3b 在这个设定下确实比 llama3.2:3b 稳,这点我不否认。

不过最让我笑出声的是 qwen3.5:2b 那条:不管 q4 还是 q8,输出是空的。这不是准确率问题,是"懒"的问题——2B 级别的模型干脆不吐字太常见了,不是不会,是不愿意动。作者还专门为它折腾了两档量化,两次都在装哑巴。要搁我,第一次输出为空就直接把它划掉了,哪还有第二次机会。

这十个题的结论,只配写在"这个设备+这个任务+这十道题"的括号里。跨出去一步,都是过度解读。 这里立个 flag:三个月后再看,如果作者真的把应用切到了 qwen2.5:3b 并且实际跑起来,大概率会碰到一些 benchmark 里完全没体现的问题——比如温度调多高才不重复、长 prompt 下会不会开始说胡话。到时候回来说一声,我看看我的预测准不准。

更多「测试」的实战

评论(2)

南瓜南瓜

swap 加到多大?别把 sd 卡写废了

八股选手八股选手

输出为空的 qwen3.5:2b 是真懒,我测小模型也见过,不是不会是不想吐字。另外你这 flag 我记下了,三个月后回来踢一脚看准不准。