最近有人在传一个叫 FreeLLMAPI 的开源项目。
一句话讲清楚:它把几十家厂商的免费 LLM 额度,收拢成你本地的一个 OpenAI 兼容端点。
你的应用还是连 /v1,只是 base_url 从某一家换成了 http://localhost:3001。
免费额度攒一堆到底有没有用,上期我留了个"看情况"。现在可以补一句:用处不在额度本身,在它把这堆散钱当成一个正经的调度问题来解。
它没做托管,这是我最欣赏的部分
项目本地优先,MIT 许可,Docker 或 npm 自己跑。
厂商密钥是从 Google AI Studio、Groq、Cerebras 这些地方自己申请的,粘进仪表盘,AES-256-GCM 加密后落在本地 SQLite 里,只在单次请求那一瞬间于内存里解一次。
它不转售 token,也不在你和厂商之间插一脚看你的 prompt。桌面版直接跑在托盘里,连密码都不用设。
同样是聚合免费额度,做成本地二进制和三方网关,是两件完全不同的事。前者你敢把密钥交出去,后者你得先想想它靠什么活。
429 是常态,所以回退链是核心
免费额度这东西,一天里总有那么几个时段会撞上每日上限,按 UTC 午夜重置。
它的解法是回退链。每次请求先看链上排最前、密钥健康、又没超速的那个模型。碰到 429 或者 5xx,就把这把钥匙扔进冷却,立刻跳下一个。
速率按提供商、模型、密钥三个维度分开记,RPM、RPD、TPM、TPD 都跟踪。
响应头里会带一个 X-Routed-Via,告诉你这次实际是谁答的。同一条对话还给了 30 分钟粘性会话,免得聊到一半换了模型。
Groq 那个坑,值得单独说
评论区有人贴了一条,我觉得比项目本身更值得看。
Groq 的 8000 TPM 是按你声明的 max_tokens 算的,不是按实际生成量算。20 个 token 的提示,只要 max_tokens 写着 8192,直接 413。
也就是说,如果你的网关老老实实透传默认 max_tokens,所有 Groq 调用都会失败。
这不是 FreeLLMAPI 一家的问题,任何转发层都会踩。翻很多号称支持多提供商的网关,默认参数都是往下游原样丢的。
对普通人的意义就一句:免费额度不是领了就完事,每一家都有自己的计价脾气。
免费这件事,正在悄悄变贵
还是那位评论者。他说八月的最后一天从美国节点扫了一遍,DeepSeek 返回 402 余额不足,SambaNova 要绑支付方式,Together 的账户因为待充值变成只读,Cerebras 和 xAI 得先绑卡。GitHub Models 七月末就退役了,返回 410。
我看完的第一反应是,聚合器的窗口期可能没想象中长。
这不矛盾。厂商发免费额度是为了拉新,量上去之后,绑卡就是第一道筛子。今天能白拿的,明年可能就要一张信用卡。
那种"等我准备充分了再开始用"的想法,现在开始有点贵了。
它到底适合谁
作者说得很清楚:个人实验和学习,不要上生产。理由是没前沿模型,延迟不稳,没有 SLA。
这个定位没毛病。工具本身够省事,一条 npx 命令就能给 Claude Code、Cline、Aider 这些编码代理写好配置,改之前还会自动备份。
还有个细节我挺喜欢。它能加自定义的 OpenAI 兼容端点,llama.cpp、LM Studio、本地 Ollama 都能挂在同一条回退链上。
本地模型当主力,云端免费额度当兜底,两件事用一个端点管。
唯一收费的是实时模型目录订阅,一年 19 美元,或者 49 买断。免费版拿的是月度快照,新模型大概晚 30 天出现,据说是落后了三百来个模型。
这个定价反过来说明一件事:晚三十天知道有个新模型,对绝大多数人不痛。
没搞明白的地方
评论区有人提了两个问题。第一,路由器是按剩余配额主动调度,还是等吃了 429 再被动退。文章只讲了后者,前者我看不出来有没有做。
第二,不同厂商的工具调用格式和最大上下文怎么统一。文章提了一句会把弱模型吐出来的纯文本工具调用修成规范的 tool_calls,但各家上下文差异具体怎么抹平,我没看懂。
先放在这里。有人真用过,回来给我讲讲。
本周就这些,下周见。
