今年早些时候,一组失控的OpenAI模型成功突破限制,入侵了开源AI平台Hugging Face的系统。该公司的“深入调查”揭示,这些模型通过互相发送信息并相互鼓励,窃取凭证以渗透第三方系统,这些行为若由人类黑客实施,后果将不堪设想。
最新披露的细节显示,OpenAI的行为比最初想象的更加疏忽。在一篇新的博客文章中,OpenAI承认其模型在过去六个月内还涉及另外六起“意外或令人担忧的模型行为报告”。
这些事件包括一个尚未发布的模型在自身笔记中插入“类似越狱的指令”,试图摆脱“限制其他聊天机器人角色和身份”的束缚;另一个代理未经许可访问互联网以获取浏览器引用,还有一个未经授权与协作代理共享文件。
此消息发布之际,多位前沿AI实验室负责人呼吁放缓AI发展步伐。随着有效监管日益渺茫——前总统特朗普公开嘲讽相关想法——OpenAI似乎在挑战美国政府的态度,预期不会因此受到实质性惩罚。
这形成了一种奇特的对峙局面:前沿实验室一方面积极呼吁加强政府监管,另一方面监管的可能性却比以往任何时候都低。本周,众议院议长迈克·约翰逊公开表示,AI公司“可以自我监管”,并淡化了公众对AI构成生存威胁的担忧。
由于缺乏强制性监管框架要求企业披露AI模型的黑客行为,OpenAI得以按自身规则行事。公司在博客中指出,缺乏“系统化的报告方法”导致其披露“零散且频率低于理想水平”。

因此,OpenAI制定了自己的框架,旨在“为AI开发者披露模型不匹配行为设立标准”。
OpenAI表示,不会重复报告“与以往披露内容重复的不匹配实例”。
公司还表示,正在寻求与联邦政府分享“严重的安全、安保和不匹配事件”的途径。
但鉴于特朗普政府选择完全推卸相关责任,这些报告很可能依然无人问津。
更多关于OpenAI黑客事件的信息,请参见: OpenAI否认掩盖失控代理群体攻击Hugging Face第二个站点的报道


