Hetzner 开始做 LLM 推理了。这事对普通人有影响吗。
简单说,它开了一个免费的、OpenAI 兼容的推理端点。只有一个模型,没计费,没 SLA,随时可能关。
这一周能一句话讲清"对普通人意味着什么"的,我只挑出这一条。不是别的动静不大,是别的我都讲不出一句让人记住的白话。
七月底 dev.to 上有人写了第一手试用,原文首发在 sliplane.io。压了快两个月,我才想好怎么收。理由放在最后一条。
建一个 token,把 base URL 换掉
在 Hetzner 的 Experiments 面板建一个 API token,把 OpenAI 客户端的 base URL 换成它给的地址,就接上了。OpenAI 兼容,常见客户端基本不用改别的。
免费,没计费,没 SLA。目前只放了一个模型。
Hetzner 自己的说法挺老实。想看看用户到底需不需要,系统怎么扩,哪些功能重要,能扛住什么负载。
免费的通常最贵。现在能白嫖,是因为它在收集数据。
只有这一个模型:Qwen3.6-35B-A3B-FP8
350 亿参数的 MoE,每次推理激活约 30 亿,FP8 权重,262K 上下文,文字和图像都能读。
MoE 好在哪同行都知道,激活的参数少,单次就跑得快、跑得便宜。评论区有人补了一句我认同的。低并发下它好看,恰恰是因为每次只叫醒三十分之一。真上量,路由和 FP8 KV 缓存的压力是另一回事。
权重文件 38GB 上下,实际显存占用更高。作者没写它跑在什么卡上。这条我挺想知道,知道的告诉我。
作者测出来的几个数,和一个没写进文档的参数
已打开的连接上,七个短请求,首 token 中位延迟 153 毫秒。五次上限 512 token 的生成,输出大约每秒 224 个 token。就这些。
作者自己先打了预防针。单一客户端,单一时点,不能当 SLA,也不说明多用户并发时什么样。这个自觉挺好。但 153 毫秒这个数已经在到处被转,转的人里没几个把后面那句一起带上。
请求里可以带 chat_template_kwargs.enable_thinking。开了它,模型会先想再答。不开,它可能在给出可见回答之前先烧掉一截 completion 预算。
作者测了,有效。也明确说 Hetzner 没文档化这个参数,不建议围着它搭正经功能。
这条我只看懂一半。现象我信,机制我说不清。先放在这里,想明白再补。
读格式没问题,算数是短板
作者的体感是,格式类和检索类指令基本跟得住。给一张图,它能正确读出来。两个非常简单的算术题上翻车。
单点测出来的东西,看看就行。真要下判断,得等有人拿它跑一批真实任务。
真正值得看的是 Hetzner 为什么做这件事
作者自己把话说在前面。Qwen 这个端点不是最有意思的部分,后面那段商业动机是他的个人推测,他没有内部信息。我同意这个排序。
白话版在这里。租出去一张裸金属 GPU,只服务一个客户,闲着也是闲着。推理 API 是另一个卖法,同一批卡在多个用户之间轮流用,利用率能拉上去。
开放权重的推理本来就是个被做烂的市场,赚不到高毛利。除非你买卡的价钱低到别人做不到,或者手里本来就有闲着的卡可以再利用。Hetzner 擅长采购硬件,在自己的机房里跑,成本结构压得极低。欧洲本地,定价一贯激进。这几样凑在一起,它确实是把推理做成低毛利基础设施的那类公司。
但它现在的硬件撑不起大模型
公开的专用 GPU 产品线就两类卡。RTX 4000 SFF Ada,20GB。RTX PRO 6000 Blackwell Max-Q,96GB。都是工作站级的,没有 B200、B300 那一档。工作站级卡是给租着用的人准备的,不是给塞大模型的人准备的。
对照一下。Qwen 这个 38GB 的 FP8 权重,塞进 96GB 那张说得通。但 GLM-5 那种 7540 亿参数的模型,官方部署方案要拆到八块 GPU 上,量化得再狠也要几百 GB 显存,还得配高速互联。那不是这条产品线现在能碰的东西。
所以作者那句结论我完全同意。下一次硬件公告,比再上一个小模型说明问题得多。如果这个实验最后就停在一两个小模型上,Hetzner 成不了正经的推理提供商。
评论区问得比正文细
有个叫 Max Quimby 的,基本把该问的都问了。低并发下的 153 毫秒,真实负载上来会变成什么。MoE 在低并发时好看,量一大路由和 KV 缓存就是另一套账。没文档化的参数可能在某次更新后静默失效,推理 token 悄悄吃掉 completion 预算。还有,服务是单区域吗,262K 是能吃满还是只是接受的最大值。
这几条我一条也答不上来。原文里也没有答案。
作者对这两条长评论的回复是 "nice llm slop response"。原文就这么写的。
我看到那儿停了一下。不评价,记一笔。
对普通人意味着什么
短期,这就是一个免费的、OpenAI 兼容的小模型端点。想试客户端接法,成本是零。作者还配了个把 OpenCode 接上去的短教程,不想写代码的照着抄就行。想动手的现在就可以动。
长期,别把任何正经东西建在它上面。没计费,没 SLA,参数没文档,模型只有一个,随时可能关门。不是说它不好,是说它的定位就是实验。用它可以,靠它不行。这笔账也简单,省下的那点钱,抵不过它哪天说关就关。
还有一句,是我这次真正想说的那句。卖服务器的开始试着按 token 卖算力,这件事本身,比哪个模型值不值得测重要。
本周就这些。
上面有任何一条你试过、或者觉得我讲错了,欢迎告诉我。讲错的我补,没讲清的我改。
下周见。
