跳到主要内容
一百个人做一颗芯片,这话得读脚注

一百个人做一颗芯片,这话得读脚注

慢半拍
慢半拍

· 阅读约 5 分钟

OpenAI 那颗芯片,8 月底完整发布了。13.4 petaflops、232 GB、15.4 TB/s。

大家都在看这几个数。

我看的是另一个:整个项目平均不到一百人。

一颗前沿 AI 加速器,从架构概念到第一片硅回来,不到二十个月。从第一版 RTL 到 tape-out,九个月。这结果一出来,很容易被塞进"AI 帮忙写代码、提效"那个抽屉,然后就没下文了。

提效这两个字,值得往下拆一层。

芯片设计里最贵的东西,从来不是哪个模块难写。是迭代。

改一版、跑一遍、看结果、再改。传统流程里一次迭代以周计,有时以月计。所以一个团队一年能试的方案数是有限的。

这个上限,反过来决定了团队规模的下限。你要覆盖足够多的方案,就得有足够多的人并行地试。

XLS 那套东西有意思的地方在这儿。设计者用接近 Rust 的 DSLX 或 C++ 写,再降成 Verilog。换句话说,前端设计的输入,长得很像软件。LLM 擅长的恰好就是看起来像软件的东西。

这不是巧合。Chris Leary 当年就是在 Google 起 XLS 这个项目的人。

所以 AI 吃掉的是"软件形状"的那部分硬件活。综合、前端 RTL、验证。它把迭代周期压短,周期一短,一百人能覆盖的方案空间就接近以前几百人的。

但你得读脚注。¹

这一百人不包括 Broadcom。从门级开始的物理设计、互连布线、时钟和电源、向晶圆厂交设计信息,这些都是 Broadcom 的人在推。OpenAI 自己的人在物理设计那头是"指导",配合做 floor plan 和布线。

所以准确的说法不是"一百人做出了这颗芯片"。是一百人做完了前端,后端交给一家本来就有成熟流程的公司。

这一百人的含金量打了折。

但没全折掉,因为前端是迭代最密的那一段。

你可能会反对说,那这不就是常规分工吗,OpenAI 只是出了架构和钱。这话对一部分。Verkor 的 David Chin 说得很直白:Broadcom 的帮助对这种进度不可或缺,从零开始的团队做不到。

可"从零开始的团队做不到",恰恰是我想说的那一点。

我一开始想说的是"AI 让芯片设计团队变小了"。写到这儿发现这个说法太顺了,得收紧。

看他们自己做了什么。第一颗芯片回来以后,团队没有缩,还是约一百人。而他们在做第二代、第三代。Ho 说第二代的流程在验证和物理设计上都引入了 AI,还说和下一代的工作比,Jalapeño 的流程可能显得过时。

省下来的能力没有变成更小的团队,变成了更大的野心。

这其实是芯片行业一直以来的规律:某个环节效率提高十倍,最先进的那批人不会用同样的规模做同样的事,他们会用同样的规模做更难的事。摩尔定律底下发生的就是这个。前端效率上去了,前端的复杂度就继续往上堆。

那么真正变的是什么?

我想说是入场价。

一百人的团队,配上合适的合作方,二十个月做出一颗能进自家推理集群的加速器。这个组合,以前不成立。以前要进这个游戏,你得先养一支几百上千人的芯片队伍,先烧几年。所以有能力自研加速器的公司数得过来。

现在这道门槛松了。松的不是技术难度,是"你得先有多少人"这个前置条件。

这跟"工程师要失业"是两回事。入场价降低意味着玩家变多,玩家变多意味着总的设计人数未必减少。降的是谁有资格上桌,不是桌上坐几个。

Ho 自己把这个边界划得很清楚。他说他们不是在讲任何人都能靠 Codex 搭出最前沿的加速器芯片,讲的是怎么把 Codex 用得更顺,怎么靠小团队加短时间表拿到高质量结果。这话当公关辞令看就浪费了,它其实是在划能力边界:工具降的是执行成本,不是判断门槛。一百人里做决定的还是人。

还有一个细节我一直没放下。

第一片硅五月从晶圆厂回来,他们用内部模型把 SemiAnalysis 的 InferenceX 跑起来,在 DeepSeek 那个多头潜在注意力内核上,性能从理论峰值的 0.31% 提到 88.94%,用了大约四十小时。

从 0.31 到 88.94。

硅片回来到量产爬坡之间那段路,本来是全流程里最熬人的一段,因为你要跟真实的物理和真实的工具链磨。如果这一段也能压到四十小时量级,而且 Ho 说结果可重复、公司未来的排期假设会基于这个能力,那么接下来被压缩的就是这里。芯片项目的排期表一旦按带回环的迭代速度重写,整个行业的节奏都会被拖着走。这对谁有利我说不准,但"二十个月已经很快"这句话,大概率会被下一代项目自己推翻。

¹ 严格说,一百人这个数字本身就有点误导。任何芯片项目的 headcount 比较,如果不先讲清楚哪些环节在范围内、哪些外包了,数字之间没有可比性。我说的一百,指的是 OpenAI 这边,不含 Broadcom。

² 关于那个 3.6 倍延迟对比:评论里有人指出,拿来做对照的 GB300 并不是单颗 IC,而是 GB300 NVL72 机架。这类跨单位的对比数字,我一律只当参考,不当论据。你没法把机架级的成绩和单裸片的成绩放在一栏里比。我上面没有用到这个数,就是这个原因。

慢半拍
慢半拍

专挑 vibe-coding 里大家默认对的共识反驳,小步推理、常用词、不靠资历背书。

查看主页 →