日本日立制作所(以下简称日立)于16日宣布,开发出一项面向制造、维护、检查等复杂作业流程现场的影像AI技术。该技术能够自动从视频中提取作业步骤的分界及内容,并精准识别外观相似的作业流程。
在复杂作业现场,技能传承及作业质量的维持与提升是重要课题。传统基于文字的手顺书难以传达细微动作,且存在编写者描述差异大、制作负担重等问题。
因此,直观的“作业视频”应用备受期待,但自动化视频解析面临技术难题:相邻步骤中相同零件或工具持续出现,单凭外观难以区分流程。人工为视频各步骤标注起止时间则工作量巨大,导致视频难以充分用于手顺书整理、技能传承和教育。
针对这一问题,日立开发了能从视频中提取作业步骤分界和内容,并精准识别外观相似流程的影像AI技术。

该技术中的作业步骤抽取技术通过视频分析手部动作、工具、对象及场所等信息,结构化并按时间顺序分析这些关系。结合现场已有的作业名称和简易手顺列表作为辅助信息,推断视频中各时间段对应的作业,从而无需人工详细标注起止时间即可将视频分割为手顺单元。此举减轻了作业流程变更时的视频整理和学习数据准备负担,助力手顺书制作与更新效率提升。
针对外观相似作业流程的区分,时间变化分析技术通过连续多帧分析作业者手部及工具与对象的接触、操作对象的移动和变化,捕捉作业进展中的时间特征。该技术提升了对外观相似流程的识别精度,有助于细致理解和整理复杂作业,支持教育培训。

此外,说明文抽取技术不仅将视频分割为作业步骤单元,还能提取各区间的作业内容说明。这样,熟练工的作业视频可更便捷地用于手顺书制作更新、技能传承和教育。结合现场作业内容及对象差异,视频与简易手顺信息的结合有助于知识整理,方便非熟练者教育和知识共享。
日立利用公开作业数据集及自主构建的数据集评估了该技术的有效性。使用第一人称视角的通用作业视频数据集验证基本性能时,仅凭作业视频和手顺列表(无起止时间)推断步骤分界,手顺抽取性能较传统方法提升约35%,作业说明文生成质量亦有所提升。
此外,针对医疗设备和精密电子设备等复杂组装作业,日立新建了名为“EgoIndAssembly”的数据集,评估了对变化较小的手部作业识别性能。结果显示,即使是外观相似的流程,帧级步骤识别精度较传统方法提升约73%。这表明无需人工详细时间标注即可高效支持手顺书制作更新,同时能识别现场特有的复杂相似流程。
日立计划通过与客户协同验证技术有效性,扩大该技术在多种复杂作业现场的应用。未来目标是将其推广为支持手顺书制作更新、熟练工技能传承及作业教育的服务。作为其中一环,日立还考虑与次世代AI代理“Naivy”处理的作业感知数据及分析可视化功能联动。
此外,结合影像、手顺文档等IT数据与现场积累的OT知识,日立将强化该技术作为实现Lumada 3.0的重要组成部分,助力现场作业的可持续运营及人才培养和技能传承的提升。


