AI资讯基于超过700万条防犯摄像头视频数据开发的专用视觉语言模型“AsillaVision”
Asilla公司利用庞大的防犯摄像头视频数据,开发出专注于异常行为检测的视觉语言模型“AsillaVision-v1-4B”,实现高精度实时分析。
按标签聚合查看文章内容。
AI资讯Asilla公司利用庞大的防犯摄像头视频数据,开发出专注于异常行为检测的视觉语言模型“AsillaVision-v1-4B”,实现高精度实时分析。
AI资讯日本NTT开发了通过理论框架增强多模态AI模型推理可信度的“根拠强化解码”技术,解决了视觉语言模型推理中根拠与结果不一致的问题。
AI资讯Gemini Robotics 2融合了多种不同的人工智能模型,形成一个统一的系统。这些模型共同赋予机器人理解周围环境并做出相应行动的能力。视觉语言模型(VLM)能够理解图像和视频,具备与人类交流及推理执行不同任务的能力。两个视觉语言动作模型(VLA)则专门训练机器人如何在物理空间中移动,分别控制机器人的全身动作和手部或抓取器的动作。 在发布前分享的视频演示中,展示了多款机器人利用这一综合模型自主
AI资讯首次有一颗地球观测卫星能够自主找到目标,无需地面人工分析师介入。这一里程碑事件发生在今年四月,标志着视觉-语言模型首次在轨道上的应用,并展示了人工智能如何从根本上改变空间传感器的能力及其价值。 传统上,卫星会将大量数据下载到地面,由分析师利用机器学习算法或人工目视进行解读。而搭载于Loft Orbital公司制造的YAM-9卫星上的软件包,则由NASA喷气推进实验室开发,能够根据自然语言查询自动识
AI资讯虽然婴儿还不会编写计算机程序、解决复杂的数学问题或进行哲学辩论,但与现今需要海量训练数据和巨大能耗的人工智能模型不同,婴儿以惊人的效率学习理解世界。他们只需观察一两次就能识别新物体,并通过短暂的观察和身体互动来学习。 在提升人工智能的过程中,婴儿及其大脑结构可能蕴含着关键的启示。打造更像婴儿的人工智能模型,或许能降低前沿模型的成本和能耗,同时对于让AI机器人以更自然的方式学习环境也极具价值。 为探
AI资讯Stockmark基于NVIDIA开源AI模型Nemotron-3-Nano-Omni,开发了专门针对日本复杂商务文档的视觉语言模型,并公开了可商用的开源版本。
AI资讯日本Preferred Networks(PFN)开发了面向无人机、机器人、监控摄像头和汽车等自主运行设备的视觉语言模型“PLaMo-VL”,并发布了8B参数的“PLaMo 2.1-8B-VL”以及小型2B参数的“PLaMo 2.1-2B-VL”。 近年来,随着物理世界环境理解和决策执行的物理AI应用日益广泛,传统云端AI面临大量传感器数据传输带来的通信负担、实时性下降以及机密信息安全风险等挑战
AI资讯利用视觉语言模型技术,将传统监控摄像头转变为具备自主判断能力的AI巡逻系统,实现异常早期发现和实时监控。