NVIDIA发布Feynman架构:3D堆叠、定制HBM与1nm芯片的"AI工厂2.0"
当整个行业还在为 Vera Rubin NVL72 的 60 exaFLOPS 数字狂欢时,NVIDIA 已经在 GTC 2026 上把目光投向了更远的未来——Feynman(费曼)架构。这不是 Rubin 的简单迭代,而是 NVIDIA 首次公开描绘”AI工厂2.0”的完整蓝图:3D芯片堆叠、定制HBM内存、1nm级制程,以及一个彻底重构的机架拓扑。
一、从”协同设计”到”物理重构”:Feynman的战略定位
如果说 Vera Rubin 的核心叙事是极端协同设计(extreme co-design)——用六颗芯片把计算、网络、存储、散热封装成一座AI工厂——那么 Feynman 则要把这场革命推向物理层面。黄仁勋在 GTC 主题演讲中明确指出:”从这里开始的下一代就是 Feynman。”
Feynman 平台由多个全新组件构成,形成完整的代际跃迁:
| 组件 | 功能定位 | 关键创新 |
|---|---|---|
| Feynman GPU | AI算力核心 | 3D die stacking、定制HBM(或超1TB/包)、TSMC A16 1.6nm制程 |
| Rosa CPU | 主机编排 | Vera的继任者,以物理学家 Rosalyn Yalow 命名 |
| LP40 LPU | 低延迟推理 | Groq与NVIDIA协同设计,用NVLink协议集成 |
| BlueField-5 DPU | 网络/存储卸载 | 第五代数据处理单元 |
| NVLink-8 | 机架级互联 | 第八代互连带宽 |
| Spectrum7 / CX10 | 交换与连接 | 共封装光学(CPO)交换机 |
值得注意的是,Feynman 的命名延续了 NVIDIA 以物理学家命名架构的传统——继 Newton、Tesla、Ampere、Hopper、Blackwell、Rubin 之后,这次轮到了量子力学奠基人 Richard Feynman。这一选择本身就在暗示:NVIDIA 正试图用”模拟量子系统”的思路来重新定义大规模并行计算。
二、三大颠覆性技术:3D堆叠与定制内存的碰撞
Feynman 最引人注目的三点创新,直接指向 AI 算力长期被诟病的三大瓶颈——带宽墙、功耗墙、物理极限。
1. 3D Die Stacking:打破平面封装的物理天花板
过去十年,NVIDIA 一直采用 CoWoS-L 2D 扇出型封装,把计算 die 和 HBM 颗粒并排平铺。但 Feynman 将首次引入3D芯片堆叠技术——通过 TSMC 的 SoIC(System on Integrated Chips)工艺,把多个计算 die 垂直堆叠在一起。
这种架构的意义在于:它大幅缩短了芯片间的物理距离,从而降低了数据搬运的延迟与功耗。在”内存墙”已成为 AI 推理最大瓶颈的今天,3D堆叠让 HBM 与计算单元更接近,理论上可以把带宽-功耗比提升一个数量级。
2. 定制HBM:突破1TB/包的显存极限
Feynman 将采用 NVIDIA 自研定制 HBM(业界普遍预测为 HBM4E 的增强版或全新的 HBM5),单包容量有望突破 1TB。作为对照,Vera Rubin 单卡为 288GB HBM4——这意味着 Feynman 的显存容量可能实现约 3.5 倍的跃升。
超大显存的战略价值在长上下文推理时代尤为关键:当模型需要把整个 KV cache 留在片上以避免跨 GPU 数据搬运时,内存容量本身就是生产力。
3. A16制程:NVIDIA的1nm级首秀
据台湾供应链报道(NVIDIA尚未正式确认),Feynman 将采用 TSMC A16(1.6nm)制程——这是 NVIDIA 首款”1纳米级别”的芯片。更先进制程不仅带来更高的晶体管密度,还显著降低了每颗晶体管的功耗,直接回应了 AI工厂高能耗的运营痛点。
三、技术深度:为什么3D堆叠是”质变”而非”量变”
要理解 Feynman 的真正价值,需要区分算力提升与数据搬运效率这两个维度。
现代大模型推理的成本瓶颈早已从”算力”转移到”数据搬运”。万亿参数模型的预填充(prefill)和解码(decode)阶段,需要在数百块GPU间移动海量激活值——网络带宽和显存容量才是真正卡脖子的一环。Vera Rubin 正是围绕这个问题重构的产物,而 Feynman 则把这场重构推向了物理极限。
1 | 传统2D封装(Rubin时代): |
3D堆叠的核心优势在于缩短数据路径。在2D架构中,计算单元与HBM之间需要复杂的平面布线;而在3D堆叠中,两者通过SoIC垂直互连直接”叠”在一起,物理距离从毫米级缩小到微米级。这不仅降低了延迟,还大幅减少了信号传输的功耗——对功耗敏感的AI数据中心而言,每一瓦特的节省都意味着成本的直接下降。
四、影响与未来展望:AI芯片竞争进入”系统+物理”双维度
Feynman 的发布,标志着 AI 芯片竞争从”单卡参数”全面升级为”系统设计 + 物理工艺“的双维度博弈。
对 NVIDIA 而言,Feynman 巩固了它在三个层面的领导地位:制程(A16 1.6nm)、内存(定制HBM突破1TB)、封装(3D堆叠)。这三者共同构成了一道竞争对手难以在短期内逾越的护城河。
对行业而言,Feynman 揭示了几个关键趋势:
AI芯片进入”物理创新”时代。当摩尔定律放缓,单纯靠制程微带来的性能提升已接近极限。3D堆叠、定制内存、共封装光学等”系统级物理创新”成为新的增长引擎。
“AI工厂”范式持续深化。从 Blackwell 的”堆芯片”到 Vera Rubin 的”建工厂”,再到 Feynman 的”重构物理”,NVIDIA 正在把整个数据中心的形态不断集成化、模块化。
竞争格局进一步固化。当 NVIDIA 用”极端协同设计 + 物理创新”构建起双重护城河时,AMD(MI400系列)和 Intel(Gaudi4)在单点技术上的追赶变得更加困难。
结语
Feynman 是 NVIDIA 为2028年准备的”终极武器”——它不只是 Rubin 的继任者,更是对 AI 算力未来形态的一次彻底重构。当3D堆叠、定制HBM和1nm制程这三项技术交汇于同一颗芯片时,我们看到的不仅是性能的提升,更是整个行业技术边界的拓展。
当然,距离 Feynman 量产还有两年时间——许多细节(尤其是A16制程)仍需供应链进一步确认。但它的发布已经清晰地告诉所有人:AI算力战争的下一站,不在更大的数据中心,而在更小的物理尺度里。 当 NVIDIA 开始用”模拟量子系统”的思路来设计芯片时,这场关于算力、内存与能源的革命,才刚刚进入深水区。
