有人把跑模型的整个过程塞进了浏览器。
简单说,MicroLLM Lab 是个浏览器端的实验项目。模型跑在你自己设备的 GPU 上,数据不出设备,不要账号,不要服务器,也不要订阅。
这条值得单独拎出来。过去想摸一下本地模型,先装一堆东西,再有一块还算过得去的卡。现在点一下按钮就行。
支持的模型,参数在 2500 万到 3.6 亿之间。
这个尺寸,说它能干什么正经活,想多了。
但门槛不能这么算。
关键是量化。权重从 16 位压到 4 位,内存占用降了大概七成五。1 亿参数以上的模型,Q4 之后放进浏览器只要 50 到 84 MB。这个数字很具体。它说明的是,跑模型这件事正在被压进一个老笔记本也扛得住的空间。
流程不复杂。点模型卡片上的加载按钮,模型缓存进浏览器 IndexedDB。挑一个,在聊天面板里试,看 tokens/s 往上跳。基准标签页能比速度和准确率,还能跑 256 token 的持续解码测试。
功能列表我不一条条复述。
真正值得看的是它的基准测试设计。里面放了目标检查,正则匹配、精确 token 匹配这一类。有意思的是,它允许 135M 的模型失败。失败本身也是测量的一部分。
这个我挺喜欢。很多工具的 benchmark 只用来展示自己多好,它把一个会翻车的尺寸摆出来,让你看见边界在哪。
还有一样。
它能生成性能证书,包含设备硬件、峰值和持续 tokens/s,可以下载成 PNG,也能复制文字摘要发出去。
这东西是给谁看的,我不太确定。自己留个底,还是发给别人比一比,都说得通。先放着。
老实说,有一处我只看懂了一半。
它带一个 JavaScript 基准测试编辑器,代码在当前 origin 里通过 eval 执行,检查对象是模型解码出来的文本,给了 object 和 function 两种写法。我能看出这是让你自己定义评测逻辑。但它怎么处理解码中途的状态,怎么防止跑偏,我没吃透。先放在这里,搞明白再补一句。
底层那块反而好懂。
运行时优先用 WebGPU,不行退到 WASM,再不行退到 JS。这三层回退本身就说明浏览器跑模型现在的处境:不是所有设备一样快,但基本都跑得起来。
顺一句。哪天你在某个设置页面看到 WebGPU 不可用、已切换到 WASM,你至少得明白它在讲什么。它讲的是,你这台设备跑得了,就是慢一点。
回到模型本身。
值不值得下,我不替你判断。589 MB 的包,GitHub 上也有仓库,灵感来自 yangqi0/petitgpt,体积你自己看一眼就有数。
我想说的是另一件事。
小模型最常见的错,是拿它跟大模型比能力。25M 到 360M 这一段,比能力必输。它真正的用处,是让你在一个完全免费的沙盒里跑一个真实的模型,摸清它的脾气。答得对的时候有多快,答错的时候错在哪儿,上下文装得下多少东西。这些得自己上手才有。
这种手感,以前要花钱、要配卡、要注册账号才能开始练。
现在前面这三样都省了。
剩下的就是你想不想点那一下。
对了,MCP 那期之后,不少人问我看这类实验项目该从哪个角度入手。我的答案一直没变:别看 demo 有多顺,看它降低了什么门槛。这个项目把门槛降到了零。
本周就这些。
上面标注只看懂一半的那段,等我弄明白再补。其余的你试过,或者觉得我讲错了,欢迎告诉我。
下周见。
