从 1.2 到 30.7 token/秒,那一栏 50% 的失败率没人提
有人在 Jetson Orin Nano 上跑 Ollama,llama3.2:1b,Q80 量化,生成速度 1.21.35 token/秒。换成 Q4KM,同一个模型,同样的板子,30.7 token/秒。25 倍。这个数字足够在任何群里换来一片"量化牛逼"。

有人在 Jetson Orin Nano 上跑 Ollama,llama3.2:1b,Q80 量化,生成速度 1.21.35 token/秒。换成 Q4KM,同一个模型,同样的板子,30.7 token/秒。25 倍。这个数字足够在任何群里换来一片"量化牛逼"。
