魔王军游戏

拥有像DGX Spark这样能够充分运行本地AI的机器,最大的优势之一就是可以毫无顾虑地并行运行多个AI智能体,也就是所谓的“多智能体”系统。

在云端AI环境中,快速并行处理会迅速消耗令牌,导致达到使用上限而停止,或者需要额外付费。但在本地AI环境下,这些都不是问题。即使全天候24小时、全年无休地运行,成本也仅限于电费。

实现本地AI多智能体的工具(框架)中,代表性的有“OpenClaw”和“Hermes Agent”。这两者的安装方法都已收录在DGX Spark的操作手册中,按照步骤即可轻松上手。

OpenClaw安装

本次我们将以OpenClaw为例,展示在DGX Spark上多智能体系统的实际运行效果。

构建自律分散型的游戏风格群聊

多智能体系统有多种类型:

  • 由主AI(指挥官)控制子AI(子智能体)的“指挥型”
  • 一个AI依次传递任务给下一个AI的“交接型”
  • 多个AI自主协作、相互影响的“自律分散型”

其中,最具AI特色的是“自律分散型”,各智能体独立思考判断,互相影响,共同得出结论。这种模式不仅体现多智能体的魅力,也更具趣味性。

那么,适合展示自律分散型多智能体的题材是什么呢?虽然分工合作完成商业资料的调研、企划、验证等是典型应用,但这次我们想加入更多趣味性,设计了一个以“魔王军会议”为主题的游戏风格多智能体聊天系统,名为“Lv.0的魔王”。

游戏大致内容如下:

  • 以魔王军的群聊为背景
  • 用户扮演魔王,与四天王讨论如何对抗勇者
  • 勇者情报由最弱的侦察四天王提供
  • 所有成员基于用户和其他成员的输入展开讨论
  • 目标是说服最弱的四天王前往勇者所在的战场
  • 如果最弱四天王被击败,其他成员会评价其为最弱,游戏即告胜利

换言之,每个智能体对应一位四天王。我们使用了两种AI模型:“Qwen3.6 35B-A3B NVFP4”和“Gemma 4 26B A4B”,每个模型负责两名四天王,通过OpenClaw运行。

为了专注体验多智能体的互动,我们将其设计为简易的聊天游戏,并借助Codex完成编码,节省开发时间并提高效率。

多智能体聊天

根据用途选择最合适的AI模型,并进行基准测试

本次选择“Qwen3.6 35B-A3B NVFP4”作为主模型,“Gemma 4 26B A4B”作为辅助模型,主要基于以下考虑:

  • 使用两个模型分别对应不同角色,增强角色个性和真实感
  • 经过多款支持日语的AI模型测试,这两款在遵循指令和稳定性方面表现最佳

AI模型选择

在日语游戏或工具中,用户与AI的对话,或AI之间的交流,语言的自然度和一致性至关重要。若回答偏离指令,或混入非日语字符,会极大影响体验。

此外,响应速度也是关键。简短对话应快速回应,若每次交互耗时数十秒,用户体验将大打折扣。

响应速度

因此,无法关闭深度思考模式(Thinking)的模型被排除。即使某些模型擅长长文本生成和校对,但在生成简洁或富有创意的幻想文本时可能表现不佳。

为了确保选用的模型符合预期,我们对包括Qwen、Gemma、Llama 4、Nemotron 3、GPT-OSS、LLM-jp-4等多款模型进行了基准测试,尽管数量众多,仍尽力覆盖主要候选。

模型基准测试

虽然通过调整提示词和参数能改善部分表现,但部分模型仍容易绕过指令,或无法通过参数调优解决问题。此次选用的两款模型在本项目中表现较为理想。

不同应用场景对AI模型的需求不同,提前进行基准测试和确认语言表达的可控性非常重要。

多智能体协作

在游戏和实际工作中广泛应用多智能体

经过一天的设计、编码和调试,我们完成了这款多智能体魔王军聊天游戏。

我们录制了游戏运行的视频,展示四天王各自独立思考并相互影响的对话过程,欢迎观看体验。

虽然本次是游戏风格的群聊,多智能体系统在并行处理不同视角和角色任务时,能大幅提升效率和效果。希望大家也能找到适合多智能体发挥的场景,轻松提升工作效率或享受更多乐趣!