Google DeepMind东京基地

2023年9月9日,Google DeepMind(简称GDM)在东京基地举办了面向媒体的圆桌会议,介绍了其研究开发的最新进展及全球战略。东京基地负责人兼首席科学家全炳河详细介绍了该基地在前沿模型开发中的核心作用,以及针对日本特有社会问题的最新研究动态。

组织深化与东京基地成立

GDM源自2010年成立于英国伦敦的DeepMind和2011年在美国加州山景城成立的Google Brain。两大组织于2023年合并,成为Google旗下的AI研发部门。2024年,Demis Hassabis等人凭借AlphaFold 2获得诺贝尔化学奖,2025年起推出Gemini系列及多种图像、视频、音乐生成模型,至2026年在AI代理和类人机器人领域持续引领技术进步。

GDM在日本的活动始于2018年由全炳河等人创立的Google Brain Japan,经过2023年整合,2025年正式成为GDM东京基地。作为亚太地区重要枢纽,东京基地与班加罗尔、新加坡等地紧密协作,致力于全球范围内的创新成果产出。

GDM组织架构

支撑前沿模型的语音AI技术基础

全炳河指出,东京基地的优势之一是开发提升整体模型智能的横向基础技术——语音AI。全炳河本人长期参与包括WaveNet在内的语音生成模型研发,东京团队汇聚了顶尖语音AI研究人员,持续推动技术创新。

在Gemini系列中,语音处理采用多模态方式,直接将语音波形转换为“语音标记”,绕过传统文本转换环节。通过语音标记器和解码器与AI模型交互,保留说话者的语调和情感,实现无缝且实时的语音对话体验。

东京团队不仅负责日语本地化,更推动Gemini核心语音能力及前沿模型基础设施的全球标准建设,已在语音标签功能发布和对话性能提升方面发挥重要作用。

语音AI技术

拓展应用领域与日本本土问题解决

东京基地在垂直领域的研发也表现突出。游戏领域参与了自2025年底启动的“SIMA”项目,该项目开发能在多种3D虚拟环境中根据自然语言指令自主行动的智能代理,融合视觉、语言和行为模型。

针对日本少子高龄化社会,基地开展基础研究,致力于让身体机能下降的老年人无需复杂操作,仅通过自然语言即可操控AI代理,辅助日常生活。成果包括缩短护理记录时间的Google Workspace护理辅助功能和面向老年人的简易界面设计。

东京基地还积极与日本国内合作伙伴协作,如与日本京都大学iPS细胞研究所(CiRA)开展AI联合科学家研究、与东京大学进行AI导师性能评估、以及与Weathernews合作改进台风预测。此外,Gemini Robotics模型已向国内合作伙伴开放,用于物理AI技术验证。

应用领域拓展

日本优势与未来挑战

全炳河认为,日本AI开发的优势在于人才储备充足及“改善”(Kaizen)精神,这种持续试错和优化的文化促进了AI研发的快速推进。然而,在追求最先进的实时语音对话技术时,计算成本与模型规模的平衡成为技术瓶颈,未来需在计算效率和模型性能间找到最佳平衡点。

谈及SIMA项目和高龄化社会相关挑战,全炳河表示,SIMA目前能完成短期任务,但实现复杂长任务仍有难度;而解决高龄化问题,首先需明确具体问题,计划从对话交互入手逐步推进。

未来展望