Intel新GPU

Intel于2024年8月24日(美国时间)在半导体研讨会Hot Chips 2026上公布了其面向数据中心的下一代GPU“Crescent Island”的详细信息。这款GPU专为面向智能代理AI推理设计,采用空冷PCIe卡设计,功耗为350W,搭载了高达480GB的超大容量LPDDR5X内存。

专为智能代理AI推理打造的Xe3P架构

近年来,AI工作负载迅速演进,从单次文本生成逐步过渡到多个AI代理协同推理,支持工具调用和长时上下文保持的“智能代理AI”模式。此类应用对推理延迟、内存容量与速度、CPU与GPU协同以及功率密度管理提出了更高要求。

Crescent Island正是针对这些需求设计,旨在提升推理时的能效比(每瓦特生成的token数量)。其采用了全新一代性能IP“Xe3P”(开发代号X3P)架构,这是基于Intel客户端产品中使用的Xe3架构的升级版。

该GPU由32个Xe核心和256个Xe矩阵扩展(XMX)引擎组成。每个Xe核心内含8个向量引擎(XVE)和8个XMX引擎,8个Xe核心组成一个计算切片(Compute Slice),共4个切片。

从Xe3到Xe3P的升级不仅增加了核心数量,还将XMX的流水线深度从4级提升至16级,支持更多数据格式,包括FP8、FP4和Microscaling(MX)格式,此外FP64双精度浮点运算性能提升8倍。还新增了多地址多队列支持及深度学习中常用的Sigmoid和Tanh函数硬件支持,通用寄存器容量也从512KB提升至1MB。

Xe3P架构

采用LPDDR5X实现最大480GB内存容量与低功耗

Crescent Island最显著的特点是其内存子系统设计。L1缓存和共享本地内存容量提升至512KB,是Xe2的两倍,且新增了32MB共享L2缓存,缓解矩阵计算引擎的数据带宽瓶颈。

不同于采用高价HBM内存,Crescent Island选用高密度且能效优异的LPDDR5X内存。Intel官方350W空冷PCIe卡版本配备160GB内存,而生态合作伙伴的定制设计最高支持480GB内存容量。

这种设计优先保证内存容量而非速度,能够支持更多并发会话,提升系统整体吞吐量,满足长上下文处理、检索增强生成(RAG)及复杂智能代理AI工作负载需求。同时,也能用更少的GPU运行更大模型,提升性能表现。

近年来,细粒度专家模型(fine-grained MoE)和投机解码技术使得生成token时的瓶颈从内存带宽转向计算量,模型规模不断扩大对内存容量的需求持续增长。LPDDR5X以较低成本实现大容量内存,成为理想选择。

内存设计

此外,Crescent Island集成了4个解码器和4个编码器,优化了多模态智能代理处理图像和视频的能力。GPU通过PCIe 5.0 x16接口与CPU连接。

媒体引擎

为满足关键任务数据中心的可靠性需求,GPU强化了RAS功能,支持内存和关键计算单元的ECC/奇偶校验保护,DMI通道的无带宽损失静默数据丢失(SDC)防护,硬件级补丁修复技术(hPPR)、巡检清理(Patrol Scrub)及PCIe错误报告(AER)等。

可靠性设计

支持投机解码与开放软件生态

在软件层面,Crescent Island从Day 0起原生支持PyTorch、Triton、vLLM、SGLang、llm-d等行业标准开源生态。通过Triton、SYCL-TLA编译器及oneDNN、oneCCL性能库,确保现有AI应用和智能代理编排环境的平滑迁移。

软件生态

综上所述,Crescent Island凭借高FLOP/W性能和大容量LPDDR5X内存,专为当前强调每瓦特token数的智能代理AI时代量身打造,展现了Intel在数据中心AI推理GPU领域的最新技术实力。

Intel GPU