人工智能正在改变我们周围的一切,但迄今为止,它主要还局限于数字领域。然而,越来越多的初创公司正试图将AI技术带入现实世界。
Perceptron是一家由两位前Meta研究科学家创立的初创公司。该公司成立于2024年11月,专注于开发前沿的视觉模型,旨在帮助机器更有效地与物理环境互动。
本周,Perceptron发布了最新模型Isaac 0.5。其开发者表示,该模型旨在赋予机器在工业环境中“感知、推理和行动”的能力。具体来说,这款软件能够帮助视觉引导机器人在仓库或工厂车间等复杂环境中导航,同时帮助企业从机器人拍摄的视频中提取视觉智能信息。
Isaac 0.5作为一个开放权重模型发布,任何人都可以查看其参数和训练材料。
这家初创公司由Armen Aghajanyan和Akshat Shrivastava共同创立,两人此前均在Meta的基础AI研究部门(FAIR)工作。他们认为自己的软件代表了工业自动化部署的未来。
公司指出:“当前的物理AI面临一个错误的选择:要么是需要多个专用云GPU支持的通用基础模型,要么是只能处理感知或控制的狭义模型,二者从未兼顾。”
Aghajanyan和Shrivastava表示,他们的工具与现有模型不同,因为它是通用型的,不针对单一重复任务,而是根据具体环境或情境灵活调整。
在一次采访中,Shrivastava让我们思考一个简单的物理过程——整理箱子:“假设现在有一台机器人被部署去分拣包裹,它需要完成哪些任务?”
这个看似简单的任务实际上包含多个步骤。机器人首先需要读取包裹上的标签,进行空间分析以了解箱子的位置,然后决定要拿起哪个箱子。如果需要搬运一系列箱子,还要规划拿取顺序。

Perceptron的软件旨在帮助机器人顺利完成每一步。虽然行业内已有软件能帮助机器完成大部分任务,但很少有程序能做到灵活应对各种情况。
那么,这种算法的“魔法”数据来源于哪里?
像Isaac 0.5这样的模型通过摄取海量视频训练数据来学习操作技能。Perceptron表示,其新模型训练时使用了百万小时的通用视频,教会算法识别特定场景、视觉元素和情境。公司还大量依赖“第一视角视频”(通常由GoPro或可穿戴摄像机拍摄,记录人类完成物理任务的视角)以及UMI视频,这些视频通过记录重复的人类动作来训练AI系统的运动能力。
虽然Perceptron未透露具体训练数据来源,Shrivastava表示公司内部构建了跨多模态的PB级数据集,涵盖图像、文本、视频乃至机器人轨迹等多种类型。
能够帮助机器人在仓库中高效运作的软件价值巨大,Perceptron认为自己有望引领这波自动化浪潮。该初创公司已准备将软件推向市场,预计其智能层将被广泛应用于多个行业。
这些行业包括制造业、物流与仓储、安全、移动出行以及媒体娱乐等。
Aghajanyan表示:“市面上没有类似的产品,我们对此非常兴奋。”
据Pitchbook数据显示,Perceptron在2024年已获得Bessemer Venture Partners、The Explorer Fund和SmartGateVC共计1600万美元的投资。TechCrunch获悉,该公司正准备完成新一轮融资。


