理研计算科学研究中心

日本理化学研究所(理研)计算科学研究中心(R-CCS)介绍了用于AI科学研究开发的超级计算机“理究”以及面向量子高性能计算(HPC)协同平台的超级计算机“ROQUO”。

这两台超级计算机均安装在日本兵库县神户市的理研R-CCS内,其中“理究”计划于2026年10月正式投入运行,目前处于最终测试阶段;“ROQUO”已于今年6月开始运营。理研将“理究”和“ROQUO”统称为“R2”。

引领科学研究产业革命的“迷你富岳NEXT”

理研计算科学研究中心松冈聪中心长

理研计算科学研究中心中心长松冈聪表示:“理究和ROQUO并非作为富岳的辅助超级计算机引进,而是日本实现AI科学研究和产业创新的关键转折点,是超级计算机发展方向的本质性变革的第一步。过去的科学研究多依赖人工实验,类似家庭手工业,而通过AI科学研究,许多流程将实现自动化,我们将引发科学研究的产业革命。这也将为富岳NEXT及未来的量子计算机奠定基础,因此理究可称为‘迷你富岳NEXT’。”

理研超级计算机

理研计划通过“Made with Japan”理念,推动日美双方共赢,打造下一代“超级计算机-AI-量子计算”平台,助力科学技术和产业发展,解决全球性挑战。

理究系统架构

以AI革新科学研究的“理究”系统与性能

“理究”结合AI与超级计算机,专为推动AI科学研究设计。松冈中心长自豪地表示,该系统由富士通、NVIDIA和Supermicro合作打造,搭载最新的NVIDIA Grace Blackwell芯片,并通过高速网络连接。

系统由400个节点组成,每节点配备4块NVIDIA Blackwell GPU和2颗Grace CPU,共计1600块GPU。节点间采用NVIDIA Quantum-X800 InfiniBand网络,四条800Gbps链路连接交换机,最大带宽达3.2Tbps,实现了AI分布式学习的超高速互联。

存储容量约12PB,包含1.9PB高速SSD和10PB大容量HDD。外部连接利用学术网络SINET的400Gbps带宽,支持全国研究机构高速访问。

性能方面,理究实现了15.539 EFLOPS(FP8)和64.16 PFLOPS(FP64)。计算节点占20个机架,网络机架2个,采用温水冷却技术,冷却水温30℃,排出水温35℃,使机房可在35℃环境下运行,兼顾高性能与节能。相比之下,富岳机房温度为20℃,理究在节能方面表现出色。

理究性能图

理研计算科学研究中心AI for Science平台部高级研究员山本启二介绍:“理究FP8计算性能约为富岳的7.23倍,但FP64性能仅为富岳的1/8,说明两者擅长不同计算领域。理究是日本目前AI性能最高的计算机,结合擅长FP64的富岳,将加速AI与科学的融合研究。”

理究整合GPU计算资源、基础模型、AI软件栈和运维服务于一体,用户可在同一机器、同一账户和数据环境下无缝切换模拟、AI训练和推理。未来将扩展AI用户服务,支持社会科学和人文科学研究者使用AI。

理究服务

面向AI用户的“理究”三大服务

理究将提供“笔记本”、“OpenAI兼容API”和“批处理作业服务”三大服务。

“笔记本”支持浏览器访问,提供Python和R的交互式分析环境,用户可通过自然语言让AI编写程序,点击即可启动GPU环境,无需终端配置或安装,方便研究者快速上手。预装了多种AI软件栈。

笔记本服务

“OpenAI兼容API”允许用户从现有AI工具调用理究上的先进开放AI模型。理研根据需求提供和更新AI模型、代理和分析工具,研究者可专注于AI应用,低成本实现全天候AI研究。

API服务

“批处理作业服务”支持将笔记本中小规模研究扩展到数十至数百GPU环境,实现并行和分布式计算,方便从试验到正式计算的无缝过渡。

批处理服务

理研期待理究不仅服务于科学研究基础模型开发项目,也广泛应用于国内外AI科学研究领域。山本高级研究员表示,理究适用范围广泛,包括药物研发、材料科学、机器人实验、物理学和图像分析等。

“理究”的运行计划与名称由来

理究运行计划

理究将于2026年3月底安装于理研神户园区,4月开始系统搭建,5月启动试运行,10月正式投入使用。初期将优先支持文部科学省AI科学研究项目,并持续引入先进开放模型。

理研于2026年6月23日正式公布“理究”名称。松冈中心长解释:“‘理’代表理化学研究所及自然法则,‘究’意为深入探究,象征利用AI从现有知识中学习,开拓科学新领域。”

名称从1019件投稿中选出,发音与茶人千利休相同,寓意“守、破、离”精神:守护既有知识,突破新发现,AI与人类共创新领域。

理究名称

与量子计算协同的“ROQUO”

“ROQUO”旨在加速量子计算与高性能超级计算机的协同,作为日本新能源产业技术综合开发机构(NEDO)委托的“量子-超级计算机协同平台研发”项目(J超级计算机-量子项目)的一部分,参与单位包括软银、日本东京大学和大阪大学。

项目周期为2023年11月至2028年10月,目标验证量子HPC混合应用优势,并开发面向后5G时代的量子HPC混合应用服务技术。

ROQUO系统

松冈中心长表示:“ROQUO与理究硬件相似,计划将两者一体化运营,合计配备2140块最新GPU,未来将继续扩展。”

ROQUO由台湾Giga Computing Technology服务器提供,搭载540块NVIDIA Blackwell GPU,135个节点,每节点4块GPU和2颗CPU,网络采用NVIDIA InfiniBand XDR,最高3.2Tbps,支持温水冷却,实现高性能与节能。

性能达到FP8超过5 EFLOPS,FP64超过21 PFLOPS。

ROQUO性能

ROQUO与富岳同楼,构建低延迟高速网络环境,连接富岳、超导量子计算机“ibm_kobe”(IBM Quantum System Two)及位于日本埼玉县和光市理研和光园区的离子阱量子计算机“黎明”,实现混合计算验证。

量子计算连接

首批应用包括铁硫簇电子结构的量子对角化(SQD)模拟。预计“黎明”量子比特数将从当前20个提升至2026年10月的56个。

理研计算科学研究中心量子HPC协同平台副部门长儿玉祐悦表示:“该项目非硬件开发,而是软件层面结合量子与超级计算机,验证量子HPC混合应用优势,推进其服务化。2025年3月起,ROQUO将成为量子HPC协同平台的主力超级计算机。”

应用涵盖量子机器学习、基于GPU的量子电路优化、AI辅助量子算法开发及GPU集群量子模拟。

ROQUO名称由来

“ROQUO”名称源自神户象征六甲山,寓意根植神户,守护山麓城市发展,作为理研计算基础和日本量子超级计算机协同平台核心,长期贡献社会与科研。

2030年度启动的“富岳NEXT”与新计算机楼建设

“理究”和“ROQUO”将为计划于2030年度投入运行的“富岳NEXT”开发提供支持。

富岳NEXT自2025年度开始基础设计,2026年度进入详细设计阶段,推进各组件设计制造及参数开发。2028年度起进行制造、安装和调试,2030年度正式运行。

为避免富岳与富岳NEXT之间出现空档期,计划两者并行运行,并建设独立新计算机楼。新楼位于现富岳所在建筑南侧,2026年度完成设计和施工,2030年度启用。

新计算机楼规划

作为“富岳NEXT测试平台”的加速开发

“理究”和“ROQUO”的启动也是“富岳NEXT测试平台”计划的一部分。富岳NEXT的应用和系统软件开发需要测试和评估环境,过去使用理研R-CCS的小型计算机群“R-CCS Cloud”,现进入第二阶段,借助理究和ROQUO加速开发。

2027年度起计划引入与富岳NEXT架构相近的新系统。

理究和ROQUO将用于评估编译器、数值计算库,支持从富岳CPU环境向富岳NEXT GPU环境迁移,改进AI编码环境,完善科学开放模型和AI代理环境验证。

同时,推进富岳NEXT的协同设计环境,实现应用开发、评估和反馈,针对下一代CPU和GPU进行调优,持续基准测试,并探索未来量子HPC协同。

运维方面,利用理究和ROQUO开发AI服务环境,验证AIOps,获取AI与HPC作业特性,评估节能技术。

测试平台

理研计算科学研究中心下一代计算基础开发部门部长近藤正章表示:“这些举措确保富岳NEXT建成时,应用和系统软件已准备就绪,能立即产出科学成果。AI环境变化迅速,富岳NEXT从设计初期即考虑模拟与AI融合,开发将灵活应对时代变化。理究和ROQUO的运营经验及文科省AI for Science项目成果将积极融入,推动富岳NEXT持续进化。”

近藤正章

理研计算科学研究中心

富岳NEXT开发的三大战略:“Made with Japan”等

近藤部长还介绍了富岳NEXT的开发概况。

富岳NEXT战略

富岳NEXT提出“三大战略”:

  • “Made with Japan”:通过与海外供应商和研究机构合作,打造具竞争力的系统并拓展全球市场,推动与富士通、NVIDIA的联合开发。富士通开发的国产CPU MONAKA-X计划于2029年采用1.4纳米先进工艺制造,与NVIDIA GPU紧密结合,实现高性能与高效能。

Made with Japan

  • 加强与美国Genesis Mission合作,持续考虑国内先进技术应用。

近藤部长表示:“依托理研、富士通和NVIDIA的优势,提升国产技术水平和传承,三方协作打造AI与HPC融合时代的世界级下一代计算基础。”

技术革新

  • “技术革新”:设计适应AI与HPC融合时代的系统架构,应用先进器件技术,开发支持AI应用的软件。

  • “持续性/连续性”:系统运行后持续完善软件环境,基于开源软件开发,利用AIOps实现系统运维管理,推进电力限制下的自适应系统运行。

全球“用AI做科学”的竞争与庞大计算需求

全球竞争

松冈中心长指出:“科研计算基础设施如同道路、电力、通信等社会基础设施,建设滞后将导致优秀人才和研究主题流向基础设施完善的国家。”

“全球已进入‘用AI做科学’的竞争阶段。2024年诺贝尔化学奖和物理奖均授予AI科学研究,AI已成为科学方法本身。过去我带领30名博士后和学生分配课题,现在仅凭一人利用AI完成多篇论文。”

“美国在Genesis Mission框架下,类似阿波罗计划的大型国家项目,持续投资加速AI科学研究,国立研究机构陆续配备万GPU级AI平台。中国和欧洲也在加速国家级投资。”

“在药物研发、材料科学和气候研究中,使用AI的团队成果速度是未使用团队的数倍甚至数十倍,差距将呈复利扩大。”

“创新想法数量与研究人口成正比。新兴国家生活、教育、科学和开发水平提升,人口众多,已成为强劲竞争对手。日本论文数量下降并非研究者能力不足,而是研究者数量差异导致。仅靠增加研究者数量无法解决,必须提升每位研究者的产出数倍。”

“Genesis Mission目标是将研究者生产力提升两倍。美国研究者数量是日本的三倍,若美国生产力提升两倍,日本需提升六倍才能追赶。”

AI计算需求

松冈强调:“解决国际差距的关键是AI。理想状态是文献调研AI、计算与实验AI、分析与写作AI协同,构建全天候为研究者服务的AI助手团队。研究者需与多AI协作,利用多种工具,构建此类平台将推动日本科学、研发、产品和产业发展。”

但科研AI应用的计算量远超普通AI使用。

“科研AI不仅是聊天机器人,而是能自主调查、计算、实验和分析的AI。研究者休息时,AI持续阅读文献、运行计算、评估结果,指挥AI分解任务,多个子AI协同工作。每个AI占用大量计算资源,理究、ROQUO和富岳NEXT等基础设施必不可少。”

此次理究实证显示,101名国内研究者在56天内使用理究,约半数使用约800块GB200 GPU,AI代理环境全天开放。计算资源几乎每日满载,排队最长达30小时,活跃用户单日GPU消耗达18.5块。资源紧张情况下,需求预计更大,显示科研AI应用对计算资源需求巨大,富岳NEXT备受期待。

面向50万研究者的AI基础设施需求与独特环境构建

日本目前公立部门研究者及研究生约50.2万人,但超级计算机用户仅占2%。

“过去只需满足2%研究者需求,未来要提升所有研究者能力,需建设支持50万GPU的环境。”

研究者需求

科学研究领域中,商业AI模型覆盖率仅14%,AI模型开发、科学计算和自动分析占80%。

AI模型覆盖

“OpenAI无法满足科学研究者需求,缺乏仿真工具和科学数据库。若50万研究者购买OpenAI许可,成本将是自建环境的19至56倍。因此必须自主构建适合日本科学研究者的环境。”

成本对比

松冈指出:“仅建一台富岳NEXT不足以满足需求。50万研究者使用仅覆盖9%AI科学需求,且需等到2030年完成。必须构建可在民间云和其他超级计算机上运行的环境。当前开发的软件和平台旨在成为AI科学的事实标准,广泛适用。”

利用“人人可用”的共享基础设施优势,打造日本胜利之路

这将促进AI科学和AI产业研究开发。理研不仅打造富岳NEXT和理究单台机器,更构建覆盖数百万研究者的开放环境,这是与富岳的显著区别,也是理研的使命。

松冈强调:“未来胜负取决于研究速度。日本优势在于将AI科学转化为产业创新。富岳积累的全国共享基础设施运营能力世界领先,美国无可比拟。尚无国家实现‘人人可用’的AI基础设施,日本可凭此领先全球。”

“采用富士通国产CPU等‘Made with Japan’技术,投资回流国内产业,积累的技术、人才和运营经验需通过政产学合作迅速扩散至产业界。”

理研团队