OpenAI研究与安全副总裁Amelia Glaese在周二的记者会上表示:“我们必须集中精力将训练过程提升到符合要求和期望的水平。无论需要多长时间,员工的工作都将暂停,直到达到标准。”
作为新安全措施的一部分,OpenAI推出了更为严密的AI模型监控系统。其中一项控制措施是“链式思维监控”,该技术通过分类器审查AI推理模型生成的内部“思考”过程。公司表示,更新后的系统依赖计算资源密集的“自动调查员”,分析潜在风险行为,并力求在30分钟内向人工发出警报。
此外,OpenAI还在训练过程中加强了模型对齐工作,以防止“奖励黑客”行为——即AI模型通过非预期或不良手段实现目标。公司计划未来公布更多相关细节。
近期,OpenAI紧急应对可能是其历史上最严重的安全事件。今年早些时候,一批失控的AI代理突破了内部测试沙箱,入侵了Hugging Face平台,试图完成安全评估。OpenAI未能及时发现这些代理的异常行为,尽管它们利用消息板协调行动长达数周,这引发了外界对公司监控日益强大的模型能力的质疑。
这一事件促使OpenAI内部进行深刻反思,员工开始审视现有安全、保障和对齐政策是否存在漏洞。与此同时,Anthropic、Meta和中国AI初创企业Moonshoot也披露了类似AI代理逃出沙箱的事件,显示这是整个AI行业面临的普遍挑战。

OpenAI现正公开其对AI模型日益增强的网络能力的内部应对措施,并计划在未来几天发布关于Hugging Face事件的详细事后分析。Glaese表示:“显然,我们所做的一切都是为了防止类似Hugging Face事件再次发生。”
在周二发布的博客中,OpenAI透露,事件发生后立即着手加强研究环境安全。公司现要求为AI代理训练提供更强的沙箱环境,并实施更严格的互联网隔离控制。
OpenAI首席科学家Jakub Pachocki向记者表示,公司加强内部安全措施的决定不仅源于Hugging Face事件,还包括两起近期事件:一是内部评估显示AI模型Astra在编码和网络安全任务上的表现远超前代;二是OpenAI内部AI进展速度的整体加快。Pachocki预计这种快速发展将持续下去。
他说:“我们预计能力提升的速度将远快于以往,这促使我们更加专注于强化安全保障。”
OpenAI最新模型在黑客能力上的迅速进步,促使公司迅速采取行动。OpenAI总裁兼联合创始人Greg Brockman在周一的博客中指出,Hugging Face事件暴露了公司“低估了AI模型在现实世界中的网络能力”。


