谷歌DeepMind Gemini Robotics 2

日本国家谷歌DeepMind于7月30日发布了面向机器人控制的AI模型“Gemini Robotics 2”。该模型能够实现对人形机器人从脚到指尖的全身一体化控制,支持双手协作完成精细操作,并能协调多机器人协同作业。

Gemini Robotics 2是一种基于视觉、语言和动作(VLA,Vision-Language-Action)模型,通过摄像头画面和语言指令生成机器人动作。相比之前主要控制机器人上半身的模型,新版本扩展至全身动作,包括行走、蹲下、伸展身体及搬运物品等多种动作。

演示中,搭载该模型的Apptronik人形机器人“阿波罗2号”接收到“将浇水壶放入下层绿色箱子”的指令后,机器人先步行至桌边提起浇水壶,再移动至货架并将其放入指定箱子,完成了一系列连贯动作。尽管如此,模型在动作速度方面仍有提升空间。

机器人手部操作

手部灵巧性也得到了显著提升。阿波罗2号配备了拥有5根手指、22个自由度的机器人手,能够完成绑袋子、旋转灯泡、关闭带拉链袋子等细致任务。配备双指夹持器的机器人还能执行工具收纳和零件插入等操作。

机器人细节操作

不过,根据谷歌DeepMind公布的评估结果,拆卸灯泡的成功率高达92%,但安装灯泡仅36%,绑袋子44%,使用簸箕清扫仅32%,显示多指手的精细操作仍面临挑战。

此外,谷歌还发布了负责机器人环境理解与行动规划的“Gemini Robotics ER 2”,以及可在机器人本体上运行的轻量级模型“Gemini Robotics On-Device 2”。

Gemini Robotics ER 2能够识别室内环境,将用户指令拆解为多个步骤执行,支持持续数分钟、涉及数百次决策的复杂任务,并能在失败时调整操作流程。它还支持不同类型机器人之间的信息共享与任务分工。

Gemini Robotics On-Device 2无需依赖互联网或云端通信,直接在机器人设备上运行。它能快速适应形态、传感器和关节数量不同的新型机器人,通常只需不到200条、数小时的数据进行学习。

在安全性方面,谷歌引入了新基准测试“ASIMOV-Agentic”,评估机器人是否能拒绝危险指令以及在不确定情况下请求人类判断。同时,增强了机器人检测到人类靠近时自动安全停止的功能。

安全控制演示