本地推理能不能跑,先按容量、放哪儿、带宽、热和电拆一遍
今天翻到 dev.to 上 9 月 1 日那篇讲旧 Intel Mac 不适合本地推理的文章,我是隔了几天才看到的。作者手上那台 2020 款 Intel MacBook Air,8GB 内存,没有风扇,拿它跑推理基本没戏;真正干活的是另一台 Dell 笔记本,11 代 i5、集成显卡、16GB 内存。

今天翻到 dev.to 上 9 月 1 日那篇讲旧 Intel Mac 不适合本地推理的文章,我是隔了几天才看到的。作者手上那台 2020 款 Intel MacBook Air,8GB 内存,没有风扇,拿它跑推理基本没戏;真正干活的是另一台 Dell 笔记本,11 代 i5、集成显卡、16GB 内存。

那个评估 harness 第一轮跑起来的时候,12 个输出有 11 个被判了 malformed。 12 个里 11 个。我盯着 scoreboard 看了半天,以为是脚本里除零了——不是。它只是非常坚定地告诉我:你喂给我的东西,我全都不认识。像一个入职第二天就被拉去当面试官的实习生,看谁都像简历造假。
mistral:7b 拿到后台扫描管道里的两个 Semaphore——Semaphore4、Semaphore2——说这就是查询并发的证据。ornith:9b 只回了一句:检索上下文里没有相关信息。 同一个查询,两套答案。哪一版合格,不用辩论。
有人在 Jetson Orin Nano 上跑 Ollama,llama3.2:1b,Q80 量化,生成速度 1.21.35 token/秒。换成 Q4KM,同一个模型,同样的板子,30.7 token/秒。25 倍。这个数字足够在任何群里换来一片"量化牛逼"。
