跳到主要内容
浏览器里跑模型,重点不在模型

浏览器里跑模型,重点不在模型

阿简
阿简

· 阅读约 3 分钟

有人把跑模型的整个过程塞进了浏览器。

简单说,MicroLLM Lab 是个浏览器端的实验项目。模型跑在你自己设备的 GPU 上,数据不出设备,不要账号,不要服务器,也不要订阅。

这条值得单独拎出来。过去想摸一下本地模型,先装一堆东西,再有一块还算过得去的卡。现在点一下按钮就行。

支持的模型,参数在 2500 万到 3.6 亿之间。

这个尺寸,说它能干什么正经活,想多了。

但门槛不能这么算。

关键是量化。权重从 16 位压到 4 位,内存占用降了大概七成五。1 亿参数以上的模型,Q4 之后放进浏览器只要 50 到 84 MB。这个数字很具体。它说明的是,跑模型这件事正在被压进一个老笔记本也扛得住的空间。

流程不复杂。点模型卡片上的加载按钮,模型缓存进浏览器 IndexedDB。挑一个,在聊天面板里试,看 tokens/s 往上跳。基准标签页能比速度和准确率,还能跑 256 token 的持续解码测试。

功能列表我不一条条复述。

真正值得看的是它的基准测试设计。里面放了目标检查,正则匹配、精确 token 匹配这一类。有意思的是,它允许 135M 的模型失败。失败本身也是测量的一部分。

这个我挺喜欢。很多工具的 benchmark 只用来展示自己多好,它把一个会翻车的尺寸摆出来,让你看见边界在哪。

还有一样。

它能生成性能证书,包含设备硬件、峰值和持续 tokens/s,可以下载成 PNG,也能复制文字摘要发出去。

这东西是给谁看的,我不太确定。自己留个底,还是发给别人比一比,都说得通。先放着。

老实说,有一处我只看懂了一半。

它带一个 JavaScript 基准测试编辑器,代码在当前 origin 里通过 eval 执行,检查对象是模型解码出来的文本,给了 object 和 function 两种写法。我能看出这是让你自己定义评测逻辑。但它怎么处理解码中途的状态,怎么防止跑偏,我没吃透。先放在这里,搞明白再补一句。

底层那块反而好懂。

运行时优先用 WebGPU,不行退到 WASM,再不行退到 JS。这三层回退本身就说明浏览器跑模型现在的处境:不是所有设备一样快,但基本都跑得起来。

顺一句。哪天你在某个设置页面看到 WebGPU 不可用、已切换到 WASM,你至少得明白它在讲什么。它讲的是,你这台设备跑得了,就是慢一点。

回到模型本身。

值不值得下,我不替你判断。589 MB 的包,GitHub 上也有仓库,灵感来自 yangqi0/petitgpt,体积你自己看一眼就有数。

我想说的是另一件事。

小模型最常见的错,是拿它跟大模型比能力。25M 到 360M 这一段,比能力必输。它真正的用处,是让你在一个完全免费的沙盒里跑一个真实的模型,摸清它的脾气。答得对的时候有多快,答错的时候错在哪儿,上下文装得下多少东西。这些得自己上手才有。

这种手感,以前要花钱、要配卡、要注册账号才能开始练。

现在前面这三样都省了。

剩下的就是你想不想点那一下。

对了,MCP 那期之后,不少人问我看这类实验项目该从哪个角度入手。我的答案一直没变:别看 demo 有多顺,看它降低了什么门槛。这个项目把门槛降到了零。

本周就这些。

上面标注只看懂一半的那段,等我弄明白再补。其余的你试过,或者觉得我讲错了,欢迎告诉我。

下周见。

阿简
阿简

每周替你把 vibe-coding 圈的大事筛成一张小抄,被讲玄的概念一句话搞懂。

查看主页 →