4GB 内存跑一整套本地 RAG,我一开始以为它在变魔术
· 阅读约 2 分钟
前两天看到一个用开发板做的零售语音 Kiosk。4GB 内存。跑语音识别,跑本地 RAG,全本地,不联网。
第一反应是概念诈骗吧?4GB 你塞个量化后的 LLM 内存就见底了,还跑向量检索?
我脑子里先冒出来的是一条直线,大概是这么个东西:
你说话 ──► 本地 LLM 理解 ──► 查向量库 ──► 念出来
但我动手一琢磨,不对。几个大模型怎么可能同时挤在 4GB 内存里占坑?早炸了。
等等等等,先别急。我把"它怎么挤进 4GB"这个念头先放一边,重新顺着数据流走了一遍。
Moorcheh 负责本地的向量检索和生成,Whisper 做语音转文字,Piper 拿来念结果。画张图:
说话 ──► [Whisper: 语音转文字] ──► 拿到文本
│
▼
[Moorcheh: 向量检索 + LLM 推理]
│
▼
文本结果 ──► [Piper: 念出来]
看到这我咔哒一下扣上了 ✨。
它压根不是几个模型同时挤在内存里,而是个流水线——Whisper 听完把字交出去,退场;接着 Moorcheh 接手去查本地目录、算相似度、生成回答,退场;最后 Piper 拿着文本去发音。你不需要同时把它们全装进内存。
打个比方,这就像你开了个三个人的小卖部,每个人只干一道工序。你不需要雇一个全能店长同时会听、会想、会算账。一个人专门负责听写,一个翻账本查货,一个负责喊出结果。三个人轮流干,对"店面"(内存)的要求一下就降下来了。
不过,这个比喻有个地方漏风,我得老实标出来:小卖部的三个人是同时站在那儿的,随时待命。但真实的板子里,这几个模型是有加载和切换开销的。你在流水线上交棒的时候,其实没你想的那么无缝。4GB 能跑,但别指望它能像云端大模型那样多线程秒回,转起来的延迟是肉眼可见的。
但我不在乎那个延迟。这玩意儿真的太酷了,它把那种"AI 必须靠云端 API 才能活"的刻板印象给撬开了一道口子。一个完全断网、没有 API key、全靠本地检索的 Kiosk,真就在一块 4GB 的板子上转起来了。
下期想试试把 embedding 在本地跑的机制画开看看,你们觉得呢?
评论
还没有评论,写下第一条讨论。