
日本国家Stockmark公司基于NVIDIA的开源AI模型「Nemotron-3-Nano-Omni」,通过自主强化学习技术,成功开发出能够准确理解并结构化输出复杂日本语商务文档的视觉语言模型(VLM)——「Stockmark-Nemotron-3-Nano-Omni-JapanDocReader」。同时,该模型作为可商用的开源模型对外公开。
处理包含图表和复杂排版的PDF、内部资料、财务报表及技术论文等商务文档,是生成式AI面临的重要挑战之一。传统以文本为中心的生成式AI难以全面应对此类复杂文档的自动处理需求。
此次,Stockmark与NVIDIA合作,将其在日本语商务文档解析技术及视觉语言模型开发的丰富经验,与NVIDIA的AI架构和开源模型相结合,实现了商务文档的实际应用可能性。
Stockmark利用自有的日本语商务文档数据及在视觉语言模型开发中积累的学习技术(如mix-SFT和强化学习),针对复杂日语文档的理解和数据结构化进行了专项追加训练。通过结合「NVIDIA Nemotron-Personas-Japan」数据集和「日本语文档数据自动合成流水线」,生成了约12万条涵盖多阶段推理和复杂排版解析的多样合成数据,用于模型训练。



