跳到主要内容
「12GB 卡跑 24GB 模型」:那半句话,谁传谁负责

「12GB 卡跑 24GB 模型」:那半句话,谁传谁负责

毒角兽
毒角兽

· 阅读约 5 分钟

先说结论:那篇讲 4070 本地跑 FLUX 的 dev.to 文章,本身及格偏上。从它嘴里长出来的那句「12GB 显卡跑 24GB 模型」,不及格。

不是一回事。原文该交代的都交代了,是转述链条把该交代的吃了。

Anna Villarreal 七月中旬发的,标签挂着 ai、image、video、local。出发点很朴素:不换机器,不追 M 系笔记本,把手里那张 4070 榨干。

光这个出发点就比大多数本地部署稿诚实。她不要跑分,她要不加钱。

流程的源头据说是一位做视频的 Richard Aragon 分享的一份 Google Colab notebook,人家还撂了一句,这套东西 4060 也能跑。

「也能跑」。二手传话就是从这三个字开始变味的。能跑,跑得动,跑得值,三件事。

进正题。先把那句被传烂的话摆正:

「12GB 显存跑 24GB 模型」

模型体积:    24 GB
显卡显存:    12 GB

怎么塞进去的,原文列了四招:

  • 4-bit NF4 量化,走 bitsandbytes
  • LoRA,基座冻住,只训低秩小矩阵
  • embedding 缓存加 latent 缓存,预计算
  • 降训练分辨率、batch 设 1 配梯度累积、梯度检查点、8-bit 优化器

同行不用我解释这四招是干嘛的。我要说的是第五件事——

原文自己写了一句:这些手段,都是拿速度或者精度换内存的。

这句是全文的命根子。

然后它在转述里蒸发得干干净净。

再看她实际干了什么。这才是这篇东西值得单独拎出来讲的原因。

她不是贴张图就走。她做了控制组:一条完全不带训练,一条 Mucha 训练,一条 EVERFLUO 风格 100 步,一条 700 步,再来一条自定义 prompt。

训练集 14 张画,配一个 metadata.jsonl,每张图跟它的描述对上,训练就读这个。

基座模型 34GB,Hugging Face 拉的。拿自己的作品训出定制风格,再以 LoRA 的形式挂回去。她管 LoRA 叫「给基座装的一片镜头」——这个说法我认。多个风格能并存,切换只换那片镜头。

她自己的结论:700 步那组比 100 步更贴目标风格;自定义 prompt 那条还不行,得继续训。

肯在正文里写「我这条输出还不够」的作者,不多!

有一说一,Mucha 那组量化之后还能保住主要特征,这点我原本不信。量化最爱砍的就是风格细节,装饰性纹样那一类先崩。这波算我预期拉满被打脸,这回是往好的方向打。

还有个细节得记一笔。她之前走的是另一条路:让 Fable 帮忙搭 ComfyUI 工作流。看着挺新鲜,产出很难看。节点复杂,夹一堆外语节点,直接把人劝退。后来才换到 notebook 这条道。

这条对做本地生成的人有用:ComfyUI 的门槛不在配置,在读别人的节点图。

接着她顺手把这套东西改成了视频工作流。目标:在 4070 上把自己一幅画变成 5 秒视频。

预期耗时:至少一小时。

输出时长:   5 s
显卡:       4070
预计耗时:   ≥ 1 h

5 秒视频,一个小时。这才是本地生成当下的真实报价单。

这里把话缩一下:这是她当时的预估,不是跑完测出来的数,后面补没补实测我没跟上。先标个问号,别拿我这半句当结论。

原文还有个地方我挺欣赏。她直说这套东西现在没有像样的 UI,只能终端加 Python 脚本跑,参数可选。

愿意把「壳还没做」写进正文的人,比那些截一张漂亮界面就敢说「开箱即用」的,可信度高一个量级。

真正让我觉得这篇该被认真读的,是评论区。

有人建议她跟进一篇,把 4070 本地跑跟云端推理按成本、速度、画质三项做对照。问题问得好,她答得更好。

她说她的目标是不额外花钱,把手头这张卡用到极限。然后给了边界:本地自定义模型适合中小业务和个人创业者;大机构里讲统一性和性能的场合,付费方案更合适。

这几句比正文值钱。

它回答了那个所有本地党都绕着走的问题:这方案到底适合谁。

她还反问回去:你的场景是一个人用,还是组织里一批人用?你能不能接受用户自己去动模型?

这两个问题,每个写「本地部署」的人都该先自己答一遍再发稿。

顺带,她提了一句自己在躲某些本地硬件要求很高的方案。知道自己不碰什么,比硬着头皮上聪明。

她的总结是:不上 5090,还能再撑一年。

这个态度我给过。本地不本地不是重点,重点是先算清楚自己这张卡还剩多少,再决定掏不掏钱。

锐评评分卡——

  • 原文可信度:认可。自己搭控制组,自己写输出不足,没把量化的代价藏起来。
  • 「12GB 跑 24GB」这句话单独传播:水分。它省掉了三件事——拿速度和精度换的、得终端手跑、5 秒视频一小时。
  • 该不该现在跟:一个人用、手上正好有张 12GB 卡、愿意折腾终端的,跟。指望开箱、指望替代云端、指望团队协作的,别跟。

这钱花得冤不冤?原文不冤。那半句话,你为它花的每一分钟都算冤。

毒角兽
毒角兽

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

查看主页 →