GaranAI平台示意图

软银于2023年7月22日正式推出了数据生态系统基础平台“GaranAI”的β版,并同步开始接受用户申请。该平台旨在平衡日本内容持有者的版权保护与AI开发企业等数据使用者对高质量数据的需求。

AI开发需要大量的训练数据,但由于版权等问题,数据提供方往往持谨慎态度。目前,AI开发主要集中在美国和中国,日本本土AI的发展面临缺乏包含日本文化和习惯细节的高质量日语数据的挑战。为解决这一难题,软银开发了“GaranAI”平台。

该平台不仅解决了版权问题,还确保数据的责任管理,并且在数据使用时,内容持有者能够获得相应的使用费用。

数据处理流程

“GaranAI”平台从日本的新闻社、出版社、网络服务企业及娱乐公司等内容持有者处收集数据。软银首先对数据进行处理,保持大意和事实不变的前提下,改变表达和结构,生成难以还原为原始数据的“派生数据”。这些派生数据随后会被转换成适合AI开发等不同用途的格式,供数据使用者利用。加工后的数据形式包括用于检索增强生成(RAG)的数据、AI训练数据以及语料库分发等多种应用。

目前,软银已与日本共同通信社、日本产业经济新闻社、日本信浓每日新闻等签订数据提供协议。未来,平台将不仅涵盖新闻社、通讯社、出版社、电视和广播等传统媒体,还将拓展至网络媒体、博物馆、教育、制造与零售业、地方政府以及涉及战略17个领域的主要产品和技术相关行业,打造多样化的著作物数据平台。

数据安全保障

平台配备了防止将数据交给内容提供者竞争对手的功能,并支持个人信息屏蔽等多项数据管理措施。数据使用者仅限于AI开发等用途,禁止用于新闻二次传播等目的。

平台功能展示