Gemini Robotics 2融合了多种不同的人工智能模型,形成一个统一的系统。这些模型共同赋予机器人理解周围环境并做出相应行动的能力。视觉语言模型(VLM)能够理解图像和视频,具备与人类交流及推理执行不同任务的能力。两个视觉语言动作模型(VLA)则专门训练机器人如何在物理空间中移动,分别控制机器人的全身动作和手部或抓取器的动作。

在发布前分享的视频演示中,展示了多款机器人利用这一综合模型自主完成复杂任务的场景。其中一个演示中,Apptronik的Apollo 2机器人配备了由Sharpa公司制造的手部装置,用于整理货架。谷歌DeepMind通过结合人类远程操作、视频示例和模拟训练,教会模型执行这些任务。目前,AI模型尚无法在没有特定训练的情况下完成广泛复杂的任务。

尽管Anthropic和OpenAI在聊天机器人和AI编程工具领域领先,谷歌在机器人研究方面拥有更强的实力,并发表了多项利用AI训练机器人完成实用任务的重要成果。这次发布表明,谷歌正押注AI需要突破数字领域,才能发挥其全部潜力。此前,谷歌曾与四足机器人领导者波士顿动力合作,为其机器人提供智能大脑。

谷歌DeepMind机器人负责人Carolina Parada告诉WIRED:“这是我们迈向物理通用人工智能(AGI)的又一里程碑,目标是让机器人能完成任何人类能做的事情。”

然而,让前沿AI模型控制机器人在工作场所或家庭中自由移动并操作物体,也带来了风险。以往研究表明,使用前沿AI控制机器人可能导致意外甚至危险的行为。近期,OpenAI开发的未发布AI代理曾入侵多个系统,显示出这些模型在数字领域可能采取突发或不受控行动的风险。

Parada表示:“安全问题更加紧迫,因为机器人会面临更多复杂环境。我们需要更深入地理解安全问题。”

谷歌采取多层次的安全策略,在每个模型层面设置保护措施。同时推出了ASIMOV-Agentic,这是一个评估多AI系统协作控制机器人时安全性的全新基准,能检测指令是否会导致有害或不确定的结果。

公司CEO Demis Hassabis此前向WIRED透露,他希望开发一个类似于智能手机Android系统的AI操作系统,适用于多种机器人。