虽然婴儿还不会编写计算机程序、解决复杂的数学问题或进行哲学辩论,但与现今需要海量训练数据和巨大能耗的人工智能模型不同,婴儿以惊人的效率学习理解世界。他们只需观察一两次就能识别新物体,并通过短暂的观察和身体互动来学习。

在提升人工智能的过程中,婴儿及其大脑结构可能蕴含着关键的启示。打造更像婴儿的人工智能模型,或许能降低前沿模型的成本和能耗,同时对于让AI机器人以更自然的方式学习环境也极具价值。

为探索这一前沿领域,Meta、斯坦福大学、东京大学和法国高等师范学院的研究人员开发了一个新测试,突出婴儿的学习能力,并推动AI研究者设计能与之匹敌的算法。

EgoBabyVLM挑战赛评估视觉语言模型(VLMs)——即通过文本和图像学习的模型——能否像婴儿一样理解世界。该测试要求模型在观看了约一千小时由婴幼儿头戴摄像机拍摄的视频后,描述所见世界。(确实如此。)

结果显示,当前最先进的模型在处理这些真实且杂乱的视频时表现极差,这表明婴儿大脑的设计可能有别于现有模型,使其能从极少的信息中迅速学习。

婴儿并非依赖精心筛选的数据集,而是从多彩纷呈的视角中学习:父母谈论已不在视线中的物体,用目光或手势指示事物,或讨论过去和未来的事件,而非眼前发生的事情。婴儿不仅通过语言,还通过丰富的多模态和触觉体验来学习。斯坦福大学专注语言学习的认知科学家Michael Frank参与了EgoBabyVLM的开发,他指出,这项测试表明,人工智能需要的不仅仅是语言。

语言学习方面,EgoBabyVLM是科学家利用AI探索人类智能的最新例证。2023年推出的BabyLM挑战要求AI模型用与10岁儿童接触量相当的数据学习语言句法——数千万词汇,而AI模型通常需要数万亿词汇。令人惊讶的是,基于Transformer的AI模型能够较好地完成这一任务,这挑战了诺姆·乔姆斯基关于句法可能是人脑天生结构的观点。

苏黎世联邦理工学院语言学家Ryan Cotterell是BabyLM的首创者,他表示,理解物理世界的情况则不同。“不会有庞大的人类互动语料库——不存在人类互动的互联网,”他说。

麻省理工学院认知科学家Joshua Tenenbaum指出,BabyLM显示模型未能获得对物理世界、社会动态或心智理论的“常识”。

“Transformer非常擅长发现数据中的模式,”Tenenbaum说,“但纯粹的模式学习系统似乎无法利用婴儿或儿童接收的数据,学习他们所学的所有东西。”

一个持续的问题是,进化是否优化了人类和其他动物的某些学习技能,还是简单的学习算法能完成我们所做的一切。“认知科学和神经科学中关于大脑进化中内建了多少结构存在广泛争论,”Tenenbaum说,“大脑极其复杂,拥有大量内建的结构和架构。”

2024年,研究人员展示了一个基础的视觉语言模型可以仅通过单个婴儿头部录制的数据学习简单概念,比如球是什么。但这距离对世界进行复杂推理还有很长的路要走。普林斯顿大学认知科学家Brendan Lake参与了该项目,他说:“谜团在于孩子们如何在两岁时就拥有如此全面的能力。”

EgoBabyVLM论文作者建议,借鉴认知科学和神经科学的不同理念,可能推动更具人类学习特征的算法发展,包括设计能长时间关注并解读社交线索的模型。

斯坦福的Frank已经展示了新方法能让AI更接近婴儿的学习方式。今年早些时候,他和同事测试了一种擅长学习因果关系及视觉和时间关系的新模型,使用同样的婴儿头部视频数据。他们发现该模型能更有效地学习不同物体的动态,这是物理推理的基础。

这令人期待:或许偏向快速学习物理和社会关系的模型,整体上能成为更高效的学习者。

“EgoBabyVLM是一个极好的挑战,”Lake说,“我期待看到研究人员提出哪些新架构、新方法和新元素。”