尽管这一举措让部分创作者感到放心,但目前仍不清楚该直播平台究竟从何时开始使用用户的帖子、直播和视频来训练亚马逊的人工智能系统。这一消息引发了人们对大型科技公司如何处理用户数据的新一轮担忧。
用户可以通过简单的操作选择退出。在Twitch网站或移动应用中,点击账户头像,进入“设置”,然后在菜单中找到“安全与隐私”部分。在这里,你会看到“生成式AI训练”选项,可以关闭该功能,阻止你的内容被用于训练AI。
不过,Twitch在该选项旁的说明中指出,“关闭此选项并不阻止Twitch和亚马逊将你的频道内容用于Twitch隐私声明中描述的其他用途。”这些用途包括利用AI技术支持的功能,帮助主播实现增长和变现,比如实时协助赞助活动、通过推荐系统发现观众,以及通过AutoMod等工具保障社区安全。
这一新设置旨在尊重创作者对其内容使用方式的决定权,但其推出也引发了关于Twitch和亚马逊此前如何使用这些内容的疑问。
在一个专门讨论该话题的论坛中,超过1.6万名创作者表达了反对意见,他们反对默认将内容用于训练亚马逊的AI系统——这一做法直到设置更新后才被广泛知晓。
此次反弹源于一次直播活动,Twitch社区负责人Mary Kish解释了此次变更的原因。她承认这一调整会引发负面反应。产品负责人Mike Minton也坦率表示,默认启用内容用于AI训练的选项是必要的,否则“没人会参与”这一过程。
Minton指出,这类机制并非Twitch独有,他认为其他开发AI系统的公司也可能从Twitch及其他服务中提取内容,用于训练模型。“我不能确定,”他说,“但我认为合理推测几乎所有公开内容都以某种方式被用来训练模型,无论是否获得许可。所以我们也必须承认,有很多事情甚至超出了我们的直接控制范围。”
这些言论引发了更多疑问:Twitch内容从何时开始被用于训练AI模型?亚马逊是否是唯一使用这些数据的公司,还是其合作伙伴也参与其中?创作者发布内容的著作权在多大程度上得到了尊重?

自2024年3月起生效的Twitch服务条款规定,用户授予Twitch及其被许可方使用、复制、修改、适应、分发及创作衍生作品的权利。然而,条款此前并未明确说明这些内容可以被用于训练生成式AI模型。
训练数据的挑战
此案例凸显了AI系统开发者面临的主要难题之一:高质量训练数据日益短缺。
尽管OpenAI等公司已与多家出版商(包括WIRED的母公司康泰纳仕)达成协议,允许使用部分内容进行训练,但随着技术进步和数据需求增长,可用数据源正在减少。由此,各种替代方案不断涌现,重新引发了关于训练过程伦理和透明度的讨论。
长期以来,Meta一直利用用户在Facebook和Instagram上分享的帖子和图片训练其AI模型。最近还曝光该公司使用员工活动数据和智能眼镜用户截屏进行训练。谷歌和YouTube也有类似情况被披露。
因此,高质量训练数据已成为继芯片、内存和电力之后,人工智能领先开发者面临的又一战略资源短缺问题。市场对创新速度的需求迫使他们部分依赖用户生成的信息,作为换取免费数字服务的代价。
本文最初发表于WIRED西班牙语版,现由西班牙语翻译而成。


