谷歌开发了多令牌预测(MTP)架构,显著提升了其设备端AI模型“Gemini Nano v3”的推理性能。该技术已应用于日本谷歌Pixel 9和Pixel 10手机,Pixel 9系列的AI处理速度提升超过50%。

Gemini Nano v3

传统的生成式AI模型一次只能生成一个令牌,虽然处理器能力充足,但内存带宽成为瓶颈。此前的推测解码方案需要运行独立的辅助模型,导致移动设备有限的RAM被大量占用。为解决这一问题,谷歌在主模型的最后一层增加了Transformer头部,冻结了“Gemini Nano v3”预训练权重,仅训练新增的MTP头部参数。

这一方法在不影响基础模型性能和安全性的前提下,实现了后期的效率优化。与启动独立模型相比,每次AI推理可节省约130MB内存。

此外,采用了“零拷贝架构”,主模型计算的数据无需复制即可复用,从而在节省内存的同时,提高了下一个令牌的预测精度。平均每条推理路径准确预测了约两个额外令牌,部分处理任务在设备端性能提升超过50%。推理步骤减少也降低了计算负担,进一步延长了电池续航时间。

性能提升示意

谷歌计划将该技术推广到未来更多设备,并持续研究适用于边缘计算环境的优化方案,包括多模式并行预测和针对特定应用场景的验证条件放宽等。