当整个行业还在为 Vera Rubin NVL72 的 60 exaFLOPS 数字狂欢时,NVIDIA 已经在 GTC 2026 上把目光投向了更远的未来——Feynman(费曼)架构。这不是 Rubin 的简单迭代,而是 NVIDIA 首次公开描绘”AI工厂2.0”的完整蓝图:3D芯片堆叠、定制HBM内存、1nm级制程,以及一个彻底重构的机架拓扑。

一、从”协同设计”到”物理重构”:Feynman的战略定位

如果说 Vera Rubin 的核心叙事是极端协同设计(extreme co-design)——用六颗芯片把计算、网络、存储、散热封装成一座AI工厂——那么 Feynman 则要把这场革命推向物理层面。黄仁勋在 GTC 主题演讲中明确指出:”从这里开始的下一代就是 Feynman。”

Feynman 平台由多个全新组件构成,形成完整的代际跃迁:

组件 功能定位 关键创新
Feynman GPU AI算力核心 3D die stacking、定制HBM(或超1TB/包)、TSMC A16 1.6nm制程
Rosa CPU 主机编排 Vera的继任者,以物理学家 Rosalyn Yalow 命名
LP40 LPU 低延迟推理 Groq与NVIDIA协同设计,用NVLink协议集成
BlueField-5 DPU 网络/存储卸载 第五代数据处理单元
NVLink-8 机架级互联 第八代互连带宽
Spectrum7 / CX10 交换与连接 共封装光学(CPO)交换机

值得注意的是,Feynman 的命名延续了 NVIDIA 以物理学家命名架构的传统——继 Newton、Tesla、Ampere、Hopper、Blackwell、Rubin 之后,这次轮到了量子力学奠基人 Richard Feynman。这一选择本身就在暗示:NVIDIA 正试图用”模拟量子系统”的思路来重新定义大规模并行计算。

二、三大颠覆性技术:3D堆叠与定制内存的碰撞

Feynman 最引人注目的三点创新,直接指向 AI 算力长期被诟病的三大瓶颈——带宽墙、功耗墙、物理极限。

1. 3D Die Stacking:打破平面封装的物理天花板

过去十年,NVIDIA 一直采用 CoWoS-L 2D 扇出型封装,把计算 die 和 HBM 颗粒并排平铺。但 Feynman 将首次引入3D芯片堆叠技术——通过 TSMC 的 SoIC(System on Integrated Chips)工艺,把多个计算 die 垂直堆叠在一起。

这种架构的意义在于:它大幅缩短了芯片间的物理距离,从而降低了数据搬运的延迟与功耗。在”内存墙”已成为 AI 推理最大瓶颈的今天,3D堆叠让 HBM 与计算单元更接近,理论上可以把带宽-功耗比提升一个数量级。

2. 定制HBM:突破1TB/包的显存极限

Feynman 将采用 NVIDIA 自研定制 HBM(业界普遍预测为 HBM4E 的增强版或全新的 HBM5),单包容量有望突破 1TB。作为对照,Vera Rubin 单卡为 288GB HBM4——这意味着 Feynman 的显存容量可能实现约 3.5 倍的跃升。

超大显存的战略价值在长上下文推理时代尤为关键:当模型需要把整个 KV cache 留在片上以避免跨 GPU 数据搬运时,内存容量本身就是生产力。

3. A16制程:NVIDIA的1nm级首秀

据台湾供应链报道(NVIDIA尚未正式确认),Feynman 将采用 TSMC A16(1.6nm)制程——这是 NVIDIA 首款”1纳米级别”的芯片。更先进制程不仅带来更高的晶体管密度,还显著降低了每颗晶体管的功耗,直接回应了 AI工厂高能耗的运营痛点。

三、技术深度:为什么3D堆叠是”质变”而非”量变”

要理解 Feynman 的真正价值,需要区分算力提升与数据搬运效率这两个维度。

现代大模型推理的成本瓶颈早已从”算力”转移到”数据搬运”。万亿参数模型的预填充(prefill)和解码(decode)阶段,需要在数百块GPU间移动海量激活值——网络带宽和显存容量才是真正卡脖子的一环。Vera Rubin 正是围绕这个问题重构的产物,而 Feynman 则把这场重构推向了物理极限。

1
2
3
4
5
6
7
8
9
10
11
传统2D封装(Rubin时代):
┌─────────────┐ 平面布线 ┌─────────────┐
│ Compute Die │◄──────────►│ HBM Stacks │
└─────────────┘ (延迟高) └─────────────┘

3D堆叠(Feynman时代):
┌─────────────┐
│ Compute Die │ SoIC垂直互连
├─────────────┤ (延迟极低)
│ HBM Stacks │
└─────────────┘

3D堆叠的核心优势在于缩短数据路径。在2D架构中,计算单元与HBM之间需要复杂的平面布线;而在3D堆叠中,两者通过SoIC垂直互连直接”叠”在一起,物理距离从毫米级缩小到微米级。这不仅降低了延迟,还大幅减少了信号传输的功耗——对功耗敏感的AI数据中心而言,每一瓦特的节省都意味着成本的直接下降。

四、影响与未来展望:AI芯片竞争进入”系统+物理”双维度

Feynman 的发布,标志着 AI 芯片竞争从”单卡参数”全面升级为”系统设计 + 物理工艺“的双维度博弈。

对 NVIDIA 而言,Feynman 巩固了它在三个层面的领导地位:制程(A16 1.6nm)、内存(定制HBM突破1TB)、封装(3D堆叠)。这三者共同构成了一道竞争对手难以在短期内逾越的护城河。

对行业而言,Feynman 揭示了几个关键趋势:

  1. AI芯片进入”物理创新”时代。当摩尔定律放缓,单纯靠制程微带来的性能提升已接近极限。3D堆叠、定制内存、共封装光学等”系统级物理创新”成为新的增长引擎。

  2. “AI工厂”范式持续深化。从 Blackwell 的”堆芯片”到 Vera Rubin 的”建工厂”,再到 Feynman 的”重构物理”,NVIDIA 正在把整个数据中心的形态不断集成化、模块化。

  3. 竞争格局进一步固化。当 NVIDIA 用”极端协同设计 + 物理创新”构建起双重护城河时,AMD(MI400系列)和 Intel(Gaudi4)在单点技术上的追赶变得更加困难。

结语

Feynman 是 NVIDIA 为2028年准备的”终极武器”——它不只是 Rubin 的继任者,更是对 AI 算力未来形态的一次彻底重构。当3D堆叠、定制HBM和1nm制程这三项技术交汇于同一颗芯片时,我们看到的不仅是性能的提升,更是整个行业技术边界的拓展。

当然,距离 Feynman 量产还有两年时间——许多细节(尤其是A16制程)仍需供应链进一步确认。但它的发布已经清晰地告诉所有人:AI算力战争的下一站,不在更大的数据中心,而在更小的物理尺度里。 当 NVIDIA 开始用”模拟量子系统”的思路来设计芯片时,这场关于算力、内存与能源的革命,才刚刚进入深水区。