Intel发布Crescent Island:用480GB LPDDR5X给AI推理换个玩法
Intel发布Crescent Island:用480GB LPDDR5X给AI推理换个玩法
过去两年,AI算力市场的叙事几乎被"HBM4 + 液冷"垄断。NVIDIA Vera Rubin 用六芯协同建起"AI工厂",AMD MI455X-Helios 以机架级带宽正面硬刚——两家都在卷峰值、卷带宽,把数据中心GPU推向了高功耗、高散热门槛的极端。就在所有人都以为"大显存必须靠HBM"时,Intel在 Hot Chips 2026 上甩出了一张完全不同的牌:Crescent Island(新月岛)。它用一张 350W 风冷 PCIe 卡、最高 480GB LPDDR5X 内存,赌上了一个被主流忽视的判断——对推理而言,显存容量有时比带宽更重要。
一、为什么是"换玩法"而不是"追参数"?
要理解 Crescent Island 的反差感,得先看清当前 AI 推理的结构性矛盾。大模型推理分两个阶段:预填充(prefill)处理超长 prompt、构建 KV cache,本质是算力受限(compute-bound);解码(decode)逐字生成,本质是内存带宽受限(memory-bound)。NVIDIA 和 AMD 把宝全押在 decode 的带宽上,于是有了 22–23 TB/s 的 HBM4 和满机柜的液冷管道。
但智能体(Agentic AI)时代改变了负载分布。当 Agent 需要摄入数千 token 的上下文、配合 MoE + 推测解码(speculative decoding) 这类新范式时,prefill 阶段的算力占比急剧上升——而 LPDDR5X 这种"又便宜又能堆到巨大容量"的内存,恰好能在一台普通服务器里塞下整个模型的权重和 KV cache。Intel 的策略很聪明:我不跟你比谁带宽高,我把数据尽量留在离计算单元最近的地方,减少搬运。
二、核心规格:为推理而生的"偏科生"
Crescent Island 基于全新的 Xe3P 架构(Panther Lake 的 Xe3 性能调校版),关键参数足以让传统认知里的"数据中心GPU"感到陌生:
| 维度 | 规格 |
|---|---|
| 架构 | Xe3P,32 个 Xe3P Core |
| 矩阵加速 | 256 个 XMX 引擎(16-deep systolic,是 Xe2/Xe3 的 4 倍深度) |
| 向量引擎 | 256 个 Xe Vector Engine |
| 缓存 | 单核 1MB GRF + 512KB L1/SLM,统一 32MB L2 |
| 显存 | 最高 480GB LPDDR5X(Intel 参考板 160GB) |
| 精度支持 | FP4 / FP8 / FP64 / MX 微缩放格式 |
| 功耗形态 | 350W 风冷 PCIe,无需液冷改造 |
最值得注意的是 XMX 引擎从 4-deep 升级到 16-deep systolic——意味着每次能处理更大块的矩阵运算,直接服务于 prefill 这类计算密集负载。更关键的是,这颗芯片完全砍掉了图形渲染管线:它不输出任何画面,是颗"纯推理"的硅片。这与 NVIDIA 在放弃 Rubin CPX(128GB GDDR7 预填充加速器)后转向 Groq LPU 的路径形成了有趣的对照——NVIDIA 选了 SRAM-first 的低延迟 decode,Intel 则押注 DRAM容量优先的高吞吐 prefill。两条路线没有绝对优劣,只是切开了推理优化的两个面。
三、技术解读:LPDDR5X 的"宽而慢"哲学
社区基于 PCB 布局估算,Crescent Island 采用约 640-bit 总线连接 20 个 LPDDR5X 颗粒,在 10.7 Gbps 下带宽约为 1.5 TB/s——相比 Rubin 的 22 TB/s 显得微不足道。但 Intel 用两个手段化解这个短板:
其一,推测解码把瓶颈从内存搬回算力。 正如前文所述,MoE 模型配合推测解码时,生成阶段的瓶颈可以重新转移到 compute-bound,而这正是 Xe3P 的强项。
其二,超大容量本身就是生产力。 Intel 算过一笔账:用 4 张满配 480GB 的 Crescent Island,就能在一台工作站里凑出约 2TB 聚合显存——足以本地运行 Kimi K3 这样的万亿参数模型。对数据不出内网的医疗、金融场景,这比采购一座液冷机架现实得多。
软件栈方面,Intel 打出了"Day 0 Ready"牌:vLLM、SGLang、llm-d 等运行时,Triton、SYCL 做内核生成,oneDNN、Level Zero、OpenCL 打底——让开发者沿用熟悉的工具链即可迁移,无需为另一颗芯片重建生态。更妙的是它与 SambaNova SN50(专为解耦 prefill 设计的加速器)的协同:两者都是风冷、低功率、可部署在现有服务器里,天然形成"GPU 负责 prefill + 专用卡负责 decode"的混合架构。
1 | # 在 Crescent Island 上用 vLLM 运行长上下文推理(伪代码示例) |
四、影响与未来展望:AI 算力市场的"第三条路"
Crescent Island 的意义不在于跑分,而在于它验证了推理芯片可以不走 HBM 独木桥。当 NVIDIA 用 NVFP4 和 NVLink 把生态护城河越挖越深、AMD 用机架级带宽正面缠斗时,Intel 选择了一个被两家都看轻的缝隙市场——低成本、风冷、大容量、预填充优先。
对行业而言,这释放了三个信号:
-
推理架构正在"解耦"。 prefill 与 decode 不再是同一颗芯片的任务,异构混合部署成为趋势。NVIDIA 自己搁置 Rubin CPX 转向 Groq LPU,恰恰证明了这个赛道的合理性——Intel 只是把同样的逻辑用更便宜的 LPDDR5X 走了一遍。
-
"边缘数据中心"迎来新机会。 当一张 PCIe 卡就能塞下万亿参数模型的权重,企业级本地推理、私有化 Agent 部署的门槛将大幅降低。这对 NVIDIA 的"AI工厂"叙事是一次重要的补充而非替代。
-
Intel 的翻身仗打在哪? Gaudi 3 错过了 5 亿美元营收目标,市场份额不足 1%。Crescent Island 是 Intel 重新进入数据中心 GPU 的关键一子——它不追求全面击败 NVIDIA,只求在推理的特定环节做到"够用且便宜"。
当然,挑战同样现实:LPDDR5X 的低带宽决定了它在传统自回归 decode 上无法与 HBM 抗衡;oneAPI 生态远不如 CUDA/ROCm 成熟;而且 Crescent Island 的客户采样要到 2026 下半年、广泛上市在 2027 年,比 Rubin 晚了整整一年。
但无论如何,当整个行业都在为 exaFLOPS 的数字狂欢时,Intel 用一张风冷卡提醒所有人:AI 算力的竞争,或许不只有一种正确答案。 当"容量"重新成为与"带宽"同等重要的指标,那条被忽视的第三条路,可能正是下一波推理成本下降的关键。
