在周二举行的Hot Chips大会上,OpenAI详细介绍了其新型芯片Jalapeño,并首次公布了该系统的基准测试结果。根据SemiAnalysis的InferenceX基准测试,Jalapeño在每用户处理的令牌数和每千瓦功率的吞吐量方面均优于当前最先进的推理处理器。

OpenAI硬件负责人Richard Ho在新闻发布会上表示:“结果显示,Jalapeño在性能上相较现有技术有非常显著的提升。它能够在单位功率下处理更多的AI任务,同时响应速度更快。这不仅使得服务大量用户变得高效,也能实现极低的延迟。”

值得注意的是,这一对比是基于Nvidia Blackwell系统,但Ho预计,到Jalapeño全面部署时,竞争对手可能已经取得了显著进展。他估计Jalapeño将在2026年底以小规模量产,2027年将实现更大规模的部署。

Jalapeño最初于去年十月发布,由OpenAI与博通公司紧密合作开发,OpenAI自身的模型也参与了开发过程。该公司计划将Jalapeño打造为一个多代平台,实现AI产品、模型、芯片和存储的协同开发。

通过这种全栈式设计,OpenAI能够针对推理过程中常见的瓶颈阶段进行优化。特别是Jalapeño旨在减少预填充和通信阶段的延迟,这两个阶段通常会成为推理处理的阻碍。

OpenAI在发布结果的博客中表示:“我们设计Jalapeño以最大限度地减少数据移动和通信延迟。这意味着模型状态,包括生成响应时使用的KV缓存,可以被明确地放置并保持本地,同时系统为每个推理阶段激活合适的计算、存储和网络组合。”