Sakana AI发布会现场

日本Sakana AI公司于9月11日正式发布了两款AI模型统一管理系统——“Fugu Max”和“Fugu Ultra v2”。这两款模型通过兼容OpenAI的API接口同步上线,现有用户只需修改一行配置参数即可无缝切换至新架构。

这两款系统针对不同应用场景进行了优化:

  • Fugu Max聚焦于以尽可能低的成本实现最佳成果;
  • Fugu Ultra v2则专注于解决复杂且多步骤任务的能力表现。

Sakana Fugu项目从今年4月的测试版起,迅速发展成为企业级的统一管理平台。发展历程包括:

  • 4月(测试版):验证多代理统一管理作为基础模型的可行性;
  • 6月(正式发布及Fugu Ultra v1):展示管理层在硬件基准测试中达到封闭前沿模型的性能;
  • 7月(Fugu-Cyber及Claude Code Interface):聚焦网络安全和编程环境的实际工作流程;
  • 8月(Sakana Chat及与NVIDIA合作):实现面向消费者的规模扩展,并开始整合NVIDIA Nemotron开源模型;
  • 9月(9月11日):发布Fugu Max和Fugu Ultra v2。

Fugu Max整合了包括NVIDIA Nemotron系列在内的多种开源权重模型和专用模型,通过动态路由将任务分配给最轻量级的模型,实现以极低的Token消耗提供先进的结果。

Fugu Max架构示意

具体特点如下:

  • 性能:在Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench以及Sakana AI自研的编码测试SWEFish等6项基准测试中获得最高综合评分;
  • 成本:每百万输入Token成本约2美元,输出Token约6美元,较Sonnet 5、GPT 5.6 Terra和Kimi K3降低40%至60%;
  • 效率:在10项基准测试中,有7项实现了成本效益的帕累托前沿扩展。

Fugu Ultra v2性能展示

Fugu Ultra v2则专注于复杂推理和软件开发等高质量输出场景。它不依赖于特定模型如Fable 5或GPT-6-Astra,而是整合了开放模型和专用模型池,避免了对单一供应商的锁定。主要优势包括:

  • 性能:在GDP.pdf、Chartography、SWEFish、DeepSWE和Toolathon等8项基准测试中,有5项获得最高或并列最高分;
  • 一致性:在8项测试中有7项进入前两名,展现了广泛任务的优异表现;
  • 前沿性:与Fugu Max不同,Fugu Ultra更注重性能极限,提供面向高质量工作负载的高性能选项。

Fugu Ultra v2应用场景