#视觉语言模型

按标签聚合查看文章内容。

谷歌Gemini现已能作为人形机器人自由行动AI资讯

谷歌Gemini现已能作为人形机器人自由行动

Gemini Robotics 2融合了多种不同的人工智能模型,形成一个统一的系统。这些模型共同赋予机器人理解周围环境并做出相应行动的能力。视觉语言模型(VLM)能够理解图像和视频,具备与人类交流及推理执行不同任务的能力。两个视觉语言动作模型(VLA)则专门训练机器人如何在物理空间中移动,分别控制机器人的全身动作和手部或抓取器的动作。 在发布前分享的视频演示中,展示了多款机器人利用这一综合模型自主

卫星首次自主识别目标——这意味着什么?AI资讯

卫星首次自主识别目标——这意味着什么?

首次有一颗地球观测卫星能够自主找到目标,无需地面人工分析师介入。这一里程碑事件发生在今年四月,标志着视觉-语言模型首次在轨道上的应用,并展示了人工智能如何从根本上改变空间传感器的能力及其价值。 传统上,卫星会将大量数据下载到地面,由分析师利用机器学习算法或人工目视进行解读。而搭载于Loft Orbital公司制造的YAM-9卫星上的软件包,则由NASA喷气推进实验室开发,能够根据自然语言查询自动识

人工智能还不如婴儿聪明——至少现在是这样AI资讯

人工智能还不如婴儿聪明——至少现在是这样

虽然婴儿还不会编写计算机程序、解决复杂的数学问题或进行哲学辩论,但与现今需要海量训练数据和巨大能耗的人工智能模型不同,婴儿以惊人的效率学习理解世界。他们只需观察一两次就能识别新物体,并通过短暂的观察和身体互动来学习。 在提升人工智能的过程中,婴儿及其大脑结构可能蕴含着关键的启示。打造更像婴儿的人工智能模型,或许能降低前沿模型的成本和能耗,同时对于让AI机器人以更自然的方式学习环境也极具价值。 为探

日本PFN推出面向无人机和机器人视觉语言模型PLaMo-VL,推动物理AI应用AI资讯

日本PFN推出面向无人机和机器人视觉语言模型PLaMo-VL,推动物理AI应用

日本Preferred Networks(PFN)开发了面向无人机、机器人、监控摄像头和汽车等自主运行设备的视觉语言模型“PLaMo-VL”,并发布了8B参数的“PLaMo 2.1-8B-VL”以及小型2B参数的“PLaMo 2.1-2B-VL”。 近年来,随着物理世界环境理解和决策执行的物理AI应用日益广泛,传统云端AI面临大量传感器数据传输带来的通信负担、实时性下降以及机密信息安全风险等挑战