Lemonade Server界面

AMD的AI技术曾被认为落后于NVIDIA和Intel,但近年来其表现显著回升,其中代表作之一便是「Lemonade Server」。

这是一款基于AMD Ryzen AI,整合多种AI运行时的本地AI执行环境。虽然名为服务器,支持远程调用AI功能,但也附带桌面客户端,方便用户在本地直接运行AI模型。

本文将介绍该客户端的基本使用方法。测试设备为搭载AMD Ryzen AI 9 HX 370的日本迷你PC,配备32GB内存,无独立GPU,仅使用内置Radeon 890M显卡。

  1. 下载即用的AI工具

访问官方主页,下载Windows安装包(.msi),免费且无需注册。

下载界面

安装后初次运行界面无显示,可在任务栏托盘找到Lemonade Server图标,右键选择“Open Lemonade App”打开客户端。

客户端界面

客户端界面类似常见聊天AI,但安装后需根据需求下载对应AI模型才能使用。左侧“SUGGESTED MODELS”列出了8类推理引擎及其模型,用户可选择下载。

模型列表

使用Ryzen AI内置GPU时,建议在AMD Software: Adrenalin Edition系统设置中将“可变图形内存”调至“Minimum”,以减少显存占用,释放更多主内存资源。

显存设置

  1. 专为NPU设计的LLM运行时「FastFlowLM」

重点关注“FastFlowLM NPU”和“Ryzen AI LLM”两类模型,均用于运行大型语言模型(LLM)。其中“FastFlowLM NPU”基于AMD NPU专用运行时“FastFlowLM”,而“Ryzen AI LLM”则依赖“Ryzen AI Software”。

以“FastFlowLM NPU”为例,左侧菜单中有数十款模型可选。本文选择了Google DeepMind最新模型“Gemma 4 Instruct E4B”的FastFlowLM版本“gemma4-it-e4b-FLM”。

模型下载

下载后点击播放按钮加载模型,加载完成后右侧图标变绿即可使用。

通过文本框输入内容,模型以每秒数字的速度回复。任务管理器显示仅NPU满负荷运行,CPU和GPU几乎空闲,表明推理完全由NPU承担。

“Gemma 4 Instruct E4B”支持图像识别,测试上传猫咪图片后,模型能准确理解并用流畅日语描述图像内容。尽管模型仅约9GB,NPU独立完成此任务令人印象深刻。

图像识别示例

“FastFlowLM NPU”下所有模型均仅用NPU运行,包括较新的“Qwen 3.5”,更新速度快。

  1. 支持NPU与GPU混合运行的「Ryzen AI LLM」

“Ryzen AI LLM”模型列表中,名称后缀有“NPU”和“Hybrid”两种,分别代表纯NPU运行和NPU+GPU混合运行。

测试“Phi-4-mini-instruct-Hybrid”时,输入文本后NPU先行处理,随后GPU全力推理。推测NPU负责理解输入,GPU负责生成回答。

混合运行示意

虽然混合运行效果尚不明朗,但整体响应速度无明显延迟,体现了“Ryzen AI Software”对CPU、GPU、NPU的协调管理。

相比“FastFlowLM NPU”,“Ryzen AI LLM”支持的模型较旧,最新模型如“Gemma 3”和“Qwen 3”仍占主导。

“gpt-oss-20b”的NPU版本虽能运行但回答质量较差,体现本地LLM运行的挑战,但NPU能尝试处理如此大型模型已属不易。

gpt-oss-20b运行

  1. 支持语音识别、语音合成与图像生成

“Lemonade”官方提供多款模型,包括两款超大模型和一款适合32GB内存的“LMX-Omni-5.5B Lite”。

加载“LMX-Omni-5.5B Lite”时,会同时启动聊天AI“Qwen3.5-4B-MTP-GGUF”、图像生成“SD-Turbo”、语音识别“Whisper-Tiny”及语音合成“kokoro-v1”四个模型,体现多功能组合。

多模型组合

但本次测试中图像生成模型“SD-Turbo”因错误未能启动,未能体验完整功能。

“Kokoro”模型仅包含“kokoro-v1”,支持文本转语音,虽不支持日语,但英语发音自然且富有抑扬,模型体积仅362MB。

语音合成

“Llama.cpp GPU”集合了多款基于通用后端“llama.cpp”的模型,测试“Gemma-4 12B-it-MTP”后,模型经过短暂思考,能用流畅日语回答。

Llama.cpp模型

“Moonshine”是轻量低延迟的语音识别引擎,支持快速将英语语音转文本,虽识别准确度受发音和麦克风影响。

Moonshine语音识别

“StableDiffusion.cpp”基于图像生成AI“Stable Diffusion”,支持多种模型如“Flux-2”和“Qwen-Image”,但本次测试均未成功运行,推测环境配置存在问题。

图像生成

“Whisper.cpp”是“Whisper”语音识别模型集合,支持多种大小版本。测试“Whisper-Large-v3-Turbo”时,日语语音能即时翻译成英文文本,体现强大翻译功能。

任务管理器显示CPU和NPU均参与处理,可能分工完成识别与翻译任务。

Whisper语音识别

  1. NPU驱动大量LLM的震撼

总结来看,虽然图像生成功能未能正常使用,但NPU在多款LLM中的实际应用令人印象深刻,实用性显著提升。

目前其他厂商的NPU在LLM领域进展有限,而AMD平台上“Lemonade Server”已支持众多NPU模型,显示出AMD对AI领域的重视和投入。

未来“Lemonade Server”预计将支持更多模型,是AMD平台用户体验本地LLM的理想选择。搭载独立GPU时,还可使用“Llama.cpp”的GPU模型,并通过“Ryzen AI Software”实现更深度整合。

虽然初学者可能对模型下载和加载流程感到困惑,但掌握步骤后操作简单。推荐AMD平台用户尝试安装“Lemonade Server”,体验本地AI的强大功能。