
AI性能基准测试介绍
目前,NPU的性能还不是大家普遍关注的焦点,但随着更高性能NPU的推出及其应用场景的增加,了解其性能将变得越来越重要。现在就对现阶段的AI性能进行测试,也颇具趣味。
在众多AI基准测试软件中,"Geekbench AI"是最便捷的选择之一。通过测试结果,我们可以更清晰地了解NPU的优势所在。下面开始具体测试。
NPU在低精度推理上的高速表现
该软件为共享软件,但在开启自动在线提交分数的试用模式下可免费使用。本文采用的正是此模式。
设置界面包含三个选项:
- 【AI Framework】:选择PC上可用的AI框架。
- 【AI Backend】:指定实际执行处理的硬件。
- 【AI Device】:选择使用的具体硬件。
在搭载日本高通Snapdragon X Plus的Copilot+ PC上,【AI Framework】仅有【ONNX】可选,【AI Backend】可选【CPU】和【QNN】。其中【QNN】是高通的AI处理统一API,包含NPU,因此选择【QNN】。而【AI Device】则显示SoC名称,无法更改。

点击下方的【Run AI Benchmark】开始测试,稍等片刻后,结果会在网页浏览器中显示。

测试结果分为三类:
- 【Single Precision Score】(单精度)
- 【Half Precision Score】(半精度)
- 【Quantized Score】(量化)
分数以英特尔CPU Core i7-10700的1500分为基准,分数翻倍即性能翻倍。
本次测试中,NPU的单精度得分为1354,半精度为18630,量化得分高达49543。

将【AI Backend】切换为【CPU】后,单精度得分为1399,半精度为2486,量化得分为5036。

虽然NPU被称为专用AI处理芯片,但在单精度计算上反而比CPU慢。然而,随着精度降低,NPU展现出压倒性的性能优势。这是因为NPU专注于低精度推理计算。
与GPU性能的对比
笔者还在配备日本英特尔Core i5-13600K CPU和日本英伟达GeForce RTX 4080 GPU的台式机上进行了测试。GPU功耗限制设为65%,以控制发热。
选择【AI Framework】为【ONNX】,【AI Backend】为【DirectML】,即可使用GeForce RTX 4080进行测试。结果显示:单精度得分35000,半精度52694,量化27077。

相比专注低精度推理的NPU,GPU即使在高精度下也能保持高性能。虽然性能还受显存速度和所用模型影响,但NPU与GPU的性能趋势差异明显。
若测试Core i5-13600K内置GPU,需选择【AI Framework】为【OpenVINO】,【AI Backend】为【GPU】。此时单精度得分2715,半精度3943,量化6182。可见,并非所有GPU都能轻松超越NPU。

总结
本次基准测试主要反映了硬件的绝对性能。NPU的优势不仅在于低精度推理速度快,还在于其低功耗运行且不占用CPU和GPU资源。通过此次测试,更加明确了AI处理应根据不同场景合理选择硬件的道理。

作者1977年出生于日本滋贺县,曾任游戏专业杂志《GAME Watch》(日本印象社)记者,现为自由撰稿人,活跃于游戏、PC、智能手机及网络等IT领域。自1990年代起为在线游戏玩家。著有多篇连载文章。


