export ANTHROPIC_BASE_URL="https://open.bigmodel.cn/api/paas/v4"
环境变量一改,Claude Code 里的请求全打到 GLM 5.2 上去了。不用动一行业务代码。这玩意儿本来就该这样——一个 HTTP 端点,发 JSON,收 JSON,完了。GLM 5.2 的定价比对面便宜得多。你真以为一个 LLM 推理服务配得上九成毛利?
这几天拿这个组合跑我那个玩具存储引擎。顺手贴段结构体:
struct kv_node {
char *key;
char *val;
size_t val_len;
struct kv_node *next;
};
前缀匹配,一次指针跳跃。内存里维护个跳表或者哈希表,加一波 TCP 连接。大模型推理也是算力密度的游戏。既然是算力,就一定会被硬件按在地上摩擦。
顺手说一句,上面那结构体是让 AI 帮我生成的。但我让模型扩展这个 KV 存储、加个过期机制时,它给我吐了快一百行。定时清理线程、读写锁、注册回调机制。
全砍了。一个单线程的玩具引擎,搞什么并发锁。模型默认给"什么都覆盖"的方案,这是训练数据里烂代码看多了的病根。工程师的活是往回砍。
说句题外话——为什么我们这么怕让一个东西只做一件事?模型没有这心理负担,它恨不得一个函数既能处理文本又能看图。写系统代码的人得有这底线。
现在阻碍我把日常 agent 全切到 GLM 5.2 上的,就两个具体短板。没法看图,自带的搜索太难用。但这俩是软件层面的坑,早晚填得上。
真正不可逆的是算力成本的结构性塌方。只要开源模型能逼近,改个 base URL 就能无缝迁移,这层溢价就薄得像纸。算力就是一堆字节在内存和寄存器之间搬来搬去。这里没有魔法。凡是将高毛利建立在通用算力搬运上的东西,最后都会被一行 make 和一份公开的权重打回原形。
