我参观了位于马萨诸塞州剑桥的一家名为Generalist AI的初创公司,目睹了机器人手臂执行简单任务,比如叠杯子、将积木放入碗中等。我惊讶于它们学习的速度,几乎像一个有血有肉的人一样。
这些机器人手臂在观看了一段简短的教学视频后,便掌握了多种任务,最令人印象深刻的是它们无需针对特定任务进行专门训练。一个最引人注目的例子是,机器人被指示用簸箕和刷子将积木扫进碗里。当刷子被移除后,机器人灵机一动,直接用簸箕像刷子一样拨动积木,将其扫入碗中。
另一个案例中,一台双臂机器人观看了一段有人拉开钱包拉链并取出钞票的视频。我目瞪口呆地看着它拉开另一种钱包的拉链,仔细地取出钞票。更神奇的是,当它无法用右手抓住钞票时,便切换到左手以获得更好的角度。“哈,”一旁的工程师说道,“它以前从没这样做过。”
Generalist的联合创始人兼CEO Pete Florence提到,这正是人们对2020年OpenAI发布的突破性大型语言模型GPT-3感到兴奋的原因。“你可以直接让模型执行新任务,它就有很大机会完成。”
Generalist专注于教机器人理解物理世界的规律,这似乎受到了人类从小就具备的直觉物理感知的启发。这种能力有助于模型将学到的知识从一个场景迁移到另一个场景。事实上,公司的一些演示让我联想到儿童在被示范任务时的即兴发挥和试验。研究人员经常对机器人做出的选择感到惊讶——比如当一根香蕉放在它面前时,它竟然用香蕉扫起了物品。虽然看似简单,但物理智能仍是机器缺乏的能力,而婴儿高效学习世界的方式或许能为AI研究者提供重要启示。
我在一间会议室见到了Florence和联合创始人兼CTO Andrew Barry,会议室俯瞰着正在用特殊夹具训练机器人的团队。公司的另一位联合创始人兼首席科学家是Andy Zeng。这三人都有令人印象深刻的背景,曾在Google DeepMind和Boston Dynamics参与开发最先进的硬件和机器人模型。
传统上,训练AI机器人执行不同任务需要输入成千上万的示例,但这种学习方式存在缺陷,比如光线变化就会让机器人难以完成任务。
Generalist和其他一些机器人初创公司正大力投资于由人类训练的通用机器人模型。公司制造了类似机器人钳子的特殊手套,手套上装有摄像头,人们用它们执行各种任务。我看到一个装满数百个此类夹具的箱子,准备发往墨西哥及其他地区的工人手中。

Florence和团队对训练机器人的具体方法守口如瓶,但表示已收集了大量高质量训练数据。与其他追求更智能机器人的公司不同,他们完全自主构建了AI模型,而非依赖开源语言模型。
熟悉Generalist工作的乔治亚理工学院机器人专家Danfei Xu表示,这家公司在追求通用机器人模型方面表现突出。“他们将这项工作推向极致,执行得非常出色,”他说。除了收集大量高质量数据外,“他们是出色的机器人专家,做了很好的科学研究。”
Xu还认为,Generalist迄今展示的成果表明他们有意将机器人投入实际商业应用。“他们是最接近可部署产品的公司。”
斯坦福大学机器人专家Karen Liu也了解该公司,她说:“Generalist的数据方法是在大规模收集物理交互数据,而不局限于某一特定机器人。他们最强的成果表明,这种策略可能奏效。”
不过,Generalist也承认其模型的学习能力尚不够稳定。机器人平均只能完成约59%的示范任务,理想状态下成功率应达到99%以上。目前尚不清楚这些技能能否推广到所有可能的任务和环境中。
尽管如此,机器人能快速学习制造等领域技能的潜力巨大。Generalist的一位工程师在某个晚上似乎意识到了这一点。一段视频记录了这段经历:工程师在两臂机器人面前堆放小杯子,想看看机器会做什么。机器人突然加入,双手抓起并叠放其他杯子。机器人将杯子整齐堆放后,工程师兴奋地大喊起来。
这篇报道摘自Will Knight的AI Lab通讯。


