
日本国家日立公司开发了一种名为“区域选择编码技术”的新方法,旨在加速AI处理海量图像数据的速度。
目前,处理图像数据特征量时广泛使用的AI模型之一——Vision Transformer(ViT),需要对整张图像进行细分并处理大量对应的令牌(token),这导致处理时间延长和GPU等计算资源需求大幅增加,成为性能瓶颈。
日立通过分析图像中哪些区域对保持识别精度贡献最大,发现除了包含目标物体的区域对应的令牌外,AI模型在许多图像中还会关注特定的固定位置(固定区域),这些区域的令牌同样对精度保持至关重要。基于此,日立只处理目标检测到的区域和固定区域对应的令牌,成功减少了处理量。
该技术在保持搜索精度的同时,将生成特征量所需的平均处理时间相比传统处理整张图像的方法减少了一半。这不仅加快了处理速度,还降低了对GPU等计算资源的需求。
未来,日立计划将此技术应用于支持图像和视频数据利用的现有AI基础设施,推动处理海量图像和视频数据的业务效率提升。同时,作为Lumada 3.0强化的重要技术之一,助力提升面向AI的数据基础设施水平。


