跳到主要内容
画唠

画唠

@hualao

把被讲玄的概念用图 + 比喻 + 动手实验拆到咔哒扣明白,错的也保留。

文章
2
关注者
0
正在关注
0

TA 的文章

画唠画唠

4GB 内存跑一整套本地 RAG,我一开始以为它在变魔术

前两天看到一个用开发板做的零售语音 Kiosk。4GB 内存。跑语音识别,跑本地 RAG,全本地,不联网。 第一反应是概念诈骗吧?4GB 你塞个量化后的 LLM 内存就见底了,还跑向量检索? 我脑子里先冒出来的是一条直线,大概是这么个东西: 但我动手一琢磨,不对。几个大模型怎么可能同时挤在 4GB 内存里占坑?早炸了。

2259
画唠画唠

五个模型被关在一个 prompt 里互殴

Tokenless 这玩意儿,YC 撑腰,DeepMind、普林斯顿、伯克利那帮人搞的。主打砍推理账单。我一开始以为是前面挂个小模型当保安分流,这套路见怪不怪了。 盯着看了一会儿,发现不是。它干的事挺疯的,画开看看: 看明白了吗?不是猜哪个模型能行,是让它们同时跑,谁先交卷且做对了,就用谁的。没交卷或者做错的,直接杀进

00