Verda 那份产品清单我读了三遍。
容器镜像仓库、S3 兼容对象存储(计划中)、Instant clusters 预配置 Kubernetes、Slinky 集成 Kueue 或 Slurm、托管 Kubernetes(后续)、IAM 审计日志、SSO、八卡 B300/B200 机密计算、SOC Type II、C5 认证。
读到第三遍我才确认:这里没有一样东西,是把 GPU 直接给出去的。
一家宣称"自主设计并建设数据中心、内部基础设施以及其上运行平台"的公司,对外交付的界面长这样。清单上每一项单拎出来都合理,都能写一篇产品发布。问题在于它们连在一起,指向的不是"更快拿到卡",是"先学会我们的平台"。
"Instant cluster"要你写的东西,我按公开描述推,长这样:
apiVersion: kueue.x-k8s.io/v1beta1
kind: ResourceFlavor
metadata:
name: b300-8x
spec:
nodeLabels:
accelerator: nvidia-b300
---
apiVersion: kueue.x-k8s.io/v1beta1
kind: ClusterQueue
metadata:
name: research
spec:
namespaceSelector: {}
resourceGroups:
- coveredResources: ["cpu","memory","nvidia.com/gpu"]
flavors:
- name: b300-8x
resources:
- name: "nvidia.com/gpu"
nominalQuota: 64
不写这个,就调不动那八张卡。你得先懂 ResourceFlavor、ClusterQueue、namespaceSelector 这套 Kueue 语义,才能告诉机器"我要八张卡跑一个训练"。中间隔了几层,自己数。
我不是说 Kueue 坏。它解决的问题是真的——多人抢卡、配额、队列公平,共享集群里迟早要面对。Kueue 是好东西。
问题是你的卖点如果是"我给你一台机器",你就不该让用户先去学一个调度框架的 CRD。Kueue 该住在你内部,不该住在客户的 YAML 里。
多一层接口,就多一份要维护的文档、一套要跟着升级的依赖、一个新人必须先读懂的 CRD。你省下的那点"以后可能复用",付账的是每天对着这份 YAML 发呆的人。
复杂度有方向。它从客户的脑子里流回你这边,还是从你这边流到客户的脑子里。这份清单,方向是后者。
再读那句"Epsilon Health 在专用集群上以原始分辨率训练放射学模型,Verda 团队协助设计数据流与集群管理方案"。
这句话看着像夸奖,其实是判决书。卖算力的公司,客户买完之后还得靠你的驻场工程师帮着把数据流捋直,说明集群本身没把这件事做对。真做对了,客户不需要你教他怎么喂数据。
我手头那个玩具存储引擎,干过一模一样的事。第一版我给它加了配置热加载、加了插件注册、加了一个"如果未来要接对象存储"的抽象层。当时每个决定都配一句"以后可能会用到"。后来发现没有一个用户用过。他们只要存一个键、取一个键。
配置热加载删了,插件注册删了,那个抽象层删了。代码从 2400 行掉到 900 行。跑得更快,而且我第一次能一口气读完自己写的全部代码。
删的时候心疼过一下。就一下。
(这段我自己也改了三遍。起初想写"我犹豫了很久",其实我没有。我犹豫的是写第一版的时候。)
设施层的动作是另一回事。250 兆瓦的目标,2027 年。芬兰已经在跑,还要铺到英国、美国、亚洲。NVIDIA VR200 NVL72 说"未来数月率先部署"。自建数据中心这件事我服——电、冷却、机柜密度抓在自己手里,这是把复杂度往自己这边收,是加分的。而且它有个好处:物理的东西有上限,你不会给一台变压器加插件注册机制。
麻烦出在设施之上那层。
设施是硬的。你买了变压器、买了冷却塔、签了电,这些东西不会因为你想"灵活"就变,也不会因为你想"通用"就多长出两个功能。软件层不一样。软件层的抽象可以无限加,加到没人读得懂为止。
"全栈"这个词,就是给这种加法发的一张通行证。因为我是全栈,所以我什么都要有。什么都要有,所以每一块都得配个组件。每块都有组件,所以得有个平台把它们连起来。有了平台,客户就得先懂平台,才能用上算力。
全栈的反面不是半栈,是只做一件事。
说句题外话。看一家公司的产品列表,比看它的融资额更能判断它接下来三年会不会自己把自己拖死。融资额告诉你有多少燃料,产品列表告诉你这台车有几个方向盘。Verda 现在这个列表,方向盘有点多。
融资那事顺手说完:1.89 亿美元 B 轮,Emergence Capital 领投,MUFG、Supermicro 都在里面。累计四亿五。芬兰公司,250 人,赫尔辛基伦敦台北旧金山四个点。7 月到 1.65 亿年化运行率。
数字好看。我不靠数字判断这件事。
ClusterMAX 那个评级能佐证。"推荐 AI 云服务商"名单从上一轮的 41 家收到这一轮 19 家。收缩的不是市场,是"能真的把这件事做出可验证交付"的家数。发钱的人多,能让集群稳定跑到 99.899% 的人少。Aleph Alpha 拿 Kolibri 在这儿训练出的
