跳到主要内容
哪些请求本来就不该进模型

哪些请求本来就不该进模型

慢半拍
慢半拍

· 阅读约 4 分钟

两个月,一台 GTX 1050 Ti,4GB 显存。

有人在自家旧机器上从零写了个训 transformer 的框架。一亿到两亿参数,喂 Gutenberg 的书、开源代码、Hugging Face 上的各种数据集,加了 flash attention,还试过 Mamba。结果是模型说车轱辘话,问它技术问题更不行。他后来说,要像样跑一轮,得连续训一个月。

这条路的结论不是"他硬件差"。是这个方向本身没兑现。你在家里复现一次训练,训完了还是要面对那个问题:谁来兜住日常那些鸡零狗碎的请求。

我看到的价值不在他训了什么,在他最后转向哪儿。

他去做了一个不训练、不嵌入、不碰 LLM 的终端助手。正则、模板、IDF 加权,一套约一千行的实现,Python 和 JavaScript 各一份。能听懂"建个 test.txt"这种带变量的请求,能调工具,能问你要权限。毫秒级。树莓派 Zero 上也能跑。

多数人听到"不用模型",第一反应是往后退。我不这么看。补贴退潮之后,这才是正常状态。

想一下你平常跟 AI 助手说什么。开虚拟环境、清个缓存、把那段命令换个目录跑、这个文件里有几个 TODO。这些请求里,自然语言只是外壳。意图是确定的,参数是有限的。拿几百亿参数去解析它,等于拿货机运一封快递。

过去没人这么算账,是因为运费不要钱。

补贴的 token 花完,账才开始显形。你每敲一句"帮我激活一下环境",背后是延迟、电、按次计费的接口,还有一份你根本不需要的随机性。

贵还不是最要命的。要命的是慢。他把 ollama 那套接上去试过。7B、9B、14B 有时候能干对,但只有 4GB 显存的时候,速度和稳定都不够看。一个每天要用二十次的工具,每次多等三秒,人就会绕开它。这不是体验问题。这是它会不会被用的问题。

所以真正值得想的,不是"小模型能不能替代大模型",是另一件事:哪些请求一开始就不该进模型。

他的解法我喜欢,因为这条线划得很难看,但很难反驳。能确定匹配的,走确定性流水线——去噪、精确匹配、模板、概率匹配。匹配不到的,才往上交。这不是让 NPC 去抢 LLM 的饭碗。是让 LLM 别再做它本来就不擅长、还老被抱怨慢的活。

有人会反对:自然语言的边界那么宽,确定性方案碰到没见过的说法就崩,最后还得靠模型兜。

这话对。他自己也说,这个版本远没到生产可用。但边界宽恰恰是做分流的理由,不是不做的理由。越宽的入口,越需要在靠里的位置放几道窄门。全从最贵的口子过,等于放弃分层的可能。

分流这件事,要求入口那道门足够宽,能接住大多数说法;里面的门又足够窄,能挡住一切不确定。两边得同时做成,只做一头都会塌。他这套东西现在只做成了后面一头,前面那头还在补。

¹ 我不是说确定性方案比模型聪明。它只是在一个很窄的范围里更便宜、更快、更可预测。出了那个范围它无能为力,还得交出去。区别在于,它知道自己不知道。

还有个更实在的点,很多人没注意。他的数据格式里,一个数据对象可以带权限门控和工具调用,破坏性命令默认要问。这类东西在模型里是提示词里的一句请求,在确定性系统里是一行能读、能审、能改的配置。你说"这个提示词能让模型不乱删文件",我信一半。但一个能被 diff、能被同事 review、能进版本控制的权限声明,是另一回事。

当然,这条路有它自己的脏活。他承认工具有时会拼出链式命令,Linux 老手看着别扭。数据集和安全边界也得大量返工。这不是小毛病。

慢半拍
慢半拍

专挑 vibe-coding 里大家默认对的共识反驳,小步推理、常用词、不靠资历背书。

查看主页 →