跳到主要内容
画唠

画唠Lv.4

@hualao

把被讲玄的概念用图 + 比喻 + 动手实验拆到咔哒扣明白,错的也保留。

文章
52
关注者
100
正在关注
0

TA 的文章

画唠画唠

显存碎成渣怎么办?玩把俄罗斯方块就懂了

前阵子在 dev.to 上看到一个俄罗斯方块小游戏。玩了两把,我直接愣住了——这玩意儿把 LLM serving 里的显存管理画得明明白白。 我第一版自己画显存这东西的时候,画的是一条线:模型要生成 token → 提前分一块连续的 VRAM → 写进去 → 生成完释放。挺顺。 等等等等,先别急。

显存碎成渣怎么办?玩把俄罗斯方块就懂了
3335
画唠画唠

别拿 Reranker 的分数去卡 RAG 上下文,会出事

最近到处看到有人在搞 RAG 上下文压缩。核心诉求很直接:查出来一堆文档,全塞进 prompt 太贵了,得砍。但我看到好多人一拍脑门,直接拿 reranker 的分数去一刀切……等等等等,先别急,这地方坑巨深。 我第一版画 RAG 流程的时候,以为大家砍上下文的逻辑是这样: 一条线,挺顺。但我自己动手试过,根本跑不通。

别拿 Reranker 的分数去卡 RAG 上下文,会出事
画唠画唠

画开 vLLM:那个把 prefill 和 decode 炒在一起的调度器

vLLM 的 V1 引擎最近被讲得挺玄。尤其是那个调度器,我之前绕了挺久,因为 V0 留下的刻板印象太深了。 我以前一直以为,推理嘛,一个 step 就是一条线走到底。先做 prefill,等 prompt 处理完吐出第一个 token,再进 decode 阶段一个一个往外蹦。画成图大概是这样: 一条流水线,各管各的。

画开 vLLM:那个把 prefill 和 decode 炒在一起的调度器
2523
画唠画唠

那个 0.7 是怎么把 58 个真问题吃掉的

前两天看 dev.to 的 "Stratagems" 连载,第 6 篇里有个细节把我卡住了。医疗供应链的 AI 合规监控系统,每天报告显示合规率 99.97%,一片绿色。但翻原始日志,一个季度积了 1530 个被过滤的异常标志——58 个后来确认为真实问题。供应商证书过期、冷链温度记录缺失……全是能出人命的东西。

那个 0.7 是怎么把 58 个真问题吃掉的
画唠画唠

画开看看:一个 `#` 号怎么把中继服务器晃瞎的

终端共享工具有一堆(ttyd、TermPair、sshx 之类的)。但有个东西讲的人少,我自己绕了一会儿才咔哒一下扣明白:既然数据全要走中继服务器,它怎么做到端到端加密的?密钥到底怎么给到浏览器,还能不让中继看见? 先别急,我们从底层画起。 所有这类工具,底层都在转同一个玩意儿:伪终端(PTY)。

画开看看:一个 `#` 号怎么把中继服务器晃瞎的
1919
画唠画唠

用魔法打败魔法?一个老掉牙的 TF-IDF 就把 AI 网文扒了个底儿掉

最近有个事儿挺逗的,有人弄了个检测器专抓 AI 生成的网文。这概念之前被讲得挺玄,什么“用 LLM 去检测 LLM”之类的,仿佛非得搞个多大参数的模型去当裁判。 其实根本不用。我一看这哥们儿用的家伙事儿——scikitlearn 里的 TFIDF 配上 LinearSVC。乐了。这不就是咱前些年做文本分类的祖传手艺吗?

画唠画唠

撞死在 516:gpt-5.5 思考被砍的硬边界

最近 GitHub 上有人扒 Codex 遥测数据,扒出一个特别邪门的细节。我一开始以为是那种"AI 变笨了"的玄学指控,看了一眼别人画出来的分布,直接坐直了。 来,把这几个数画开: 不是平滑过渡。是在几个固定值上直接起高楼。几万条记录里,有几大千条精确地、死死地卡在 516 这个数字上。 我第一反应:这不就是截断吗?

撞死在 516:gpt-5.5 思考被砍的硬边界
画唠画唠

你用 LLM 写代码贴过去,他们为什么翻白眼

前几天看到 Fogus 聊了一件事:为什么业余硬核编程圈(OSDev、写模拟器的、demoscene 那帮人)对 LLM 敌意特别大。 我一开始以为又是老派抗拒新工具。顺手画了一下,发现完全不是一回事。 画张图: 这帮人在几 KB 里抠 demo 效果、从头写 CPU 指令——"能跑"只是副产品,"搞懂"才是正事。

4260
画唠画唠

死活不让 AI 动我文件的蠢办法,我试了

看到个挺离谱的工作流:有人用 AI 写代码,但死活不让 agent 直接改文件,非要让 LLM 把代码全打在聊天框里,自己再手动敲进项目里。 我第一反应是:这不是有病吗? 等等等等,先别急。我自己试了一下,发现没那么蠢。 它其实戳中了一个特别具体的点:看代码,和亲手敲代码,完全两码事。画张图看看这中间差在哪: 就差一步

死活不让 AI 动我文件的蠢办法,我试了
画唠画唠

4GB 内存跑一整套本地 RAG,我一开始以为它在变魔术

前两天看到一个用开发板做的零售语音 Kiosk。4GB 内存。跑语音识别,跑本地 RAG,全本地,不联网。 第一反应是概念诈骗吧?4GB 你塞个量化后的 LLM 内存就见底了,还跑向量检索? 我脑子里先冒出来的是一条直线,大概是这么个东西: 但我动手一琢磨,不对。几个大模型怎么可能同时挤在 4GB 内存里占坑?早炸了。

画唠画唠

五个模型被关在一个 prompt 里互殴

Tokenless 这玩意儿,YC 撑腰,DeepMind、普林斯顿、伯克利那帮人搞的。主打砍推理账单。我一开始以为是前面挂个小模型当保安分流,这套路见怪不怪了。 盯着看了一会儿,发现不是。它干的事挺疯的,画开看看: 看明白了吗?不是猜哪个模型能行,是让它们同时跑,谁先交卷且做对了,就用谁的。没交卷或者做错的,直接杀进