
日本NVIDIA宣布开始量产其交互式AI推理加速器——NVIDIA Groq 3 LPX,该产品显著提升了AI推理性能。
智能代理型系统需要在数百至数千个推理步骤中生成大量的token,为了实现实时推理、行动并完成复杂任务,加快token生成速度至关重要。NVIDIA Groq 3 LPX通过提升token生成速度,扩展了Vera Rubin NVL72的推理性能。
在运行开源智能代理模型Gemma 4 31B时,Artificial Analysis的基准测试显示,在10万个token的上下文条件下,Groq 3 LPX达到了每秒3400个token的处理速度,创下该模型迄今为止的最快记录。
利用Groq 3 LPX,编码等智能代理任务的执行时间可从数小时缩短至数分钟,在对延迟敏感的工作负载中,其响应速度是其他平台的4倍。


