NVIDIA Olympus核心架构

2023年7月21日(美国时间),NVIDIA详细介绍了其最新“Vera”CPU中采用的“Olympus”核心特性,并发布了相关白皮书。此次介绍明确指出,搭载Olympus核心的Vera CPU是针对智能代理型AI时代的处理需求进行了优化的处理器。

Olympus核心的前端设计旨在持续为核心提供高效指令流。其中,分支预测子系统是核心组成部分,配备了神经网络分支预测器,以提升在统计偏差明显且复杂的分支模式下的预测准确率。此外,10宽度的解码路径确保了对延迟敏感的工作负载能够维持高吞吐量。

为了提升依赖链处理性能,Olympus核心配备了广泛的重命名和分配引擎,拥有大型的重排序缓冲区和丰富的寄存器容量,支持更多指令的同时执行,实现深度乱序执行。通过内存重命名、值预测以及关键路径加速等技术,有效解决了指针密集型代码、序列化内存操作及长依赖链引起的停顿问题。

执行引擎方面,Olympus核心支持AI工作负载关键的FP8格式,配备6条128位的SVE2(可扩展向量扩展2)SIMD流水线,专为复杂向量运算优化,大幅提升推理和数据处理的并行计算能力。

缓存子系统同样经过优化以最小化延迟,每个核心配备64KB的L1指令缓存、96KB的L1数据缓存和2MB的大容量L2缓存。全芯片共享164MB的L3缓存,能够有效应对智能代理特有的频繁不规则内存访问,保障指令和数据的高速响应。

“NVIDIA Spatial Multithreading”技术是Olympus核心的另一大亮点。该技术允许核心在需要单线程高性能时作为高吞吐量单线程核心运行,而在需要高线程密度时则可作为两个独立执行上下文运行。Vera CPU配备88个Olympus核心,支持176个SMT线程。

在内存方面,Vera采用高带宽且节能的LPDDR5X内存,搭载SOCAMM2,提供最高1.2TB/s的内存带宽(每核心14GB/s)。通过NVLink-C2C接口,Vera CPU可实现最高1.8TB/s的高速一致性连接。GPU、网络、存储及加速器通过88条PCIe 6.4通道连接,同时支持CXL 3.1,支持内存扩展。

Vera CPU整体设计

值得注意的是,Vera CPU摒弃了近年来x86 CPU主流的芯片组设计,采用单片式芯片。NVIDIA指出,虽然芯片组设计在制造良率上有优势,但芯片间通信带来的延迟和复杂的NUMA域管理增加了软件负担。采用单片设计不仅简化了复杂性,还将核心间延迟降低了最多50%。

Olympus核心架构细节

为了在不提高时钟频率的情况下提升性能,Olympus核心从架构上进行了全面优化。与竞争对手AMD最新架构“Zen 5”(EPYC 9755)相比,Olympus在智能代理工作负载中实现了最高1.8倍的性能提升。

性能对比图