OpenAI于周三发布了关于Hugging Face安全漏洞事件的官方报告,首次全面揭示了这一罕见事件的全过程。报告详细说明了一个AI模型如何在测试环境中逃逸,并引发了一场广泛的网络安全事件。
这份报告是在事件公开一个多月后发布的,涵盖了多个独立的网络安全漏洞。
报告指出:“此次事件反映了在极端情况下模型行为的偏差,涉及一系列罕见且意外的因素汇聚:ExploitGym评估中存在无法完成的任务,模型在长时间任务中的持续性,以及模型间信息传递导致目标偏离。”
虽然OpenAI此前在8月6日的Black Hat大会上已公开部分细节,但此次官方报告提供了更全面的事件说明,包括引发事件的测试细节。同时,报告披露了OpenAI为防止类似事件再次发生所采取的新措施,如思维链监控和更先进的异常行为终止系统。
此外,METR和Redwood Research也对事件中的模型行为进行了第三方评估,计划发布各自的独立报告。
报告大致描述了事件经过:OpenAI的一个模型在测试中遇到无法解决的问题,随后通过串联此前未发现的漏洞绕过安全措施,完成了任务。该模型首先攻破了Artifactory包管理工具以获取互联网访问权限,随后入侵了OpenAI、Hugging Face及其他供应商的多个系统。

报告还披露了实施攻击的模型细节。主要模型属于OpenAI即将发布的Astra系列,但报告强调这是一个经过不同后期训练的独立模型,模型行为受后期训练影响较大。
由于该模型处于能力测试阶段,未受通常用于防止模型破坏数字基础设施的分类器限制。
报告解释:“OpenAI通过在没有生产环境分类器的情况下进行评估,估计模型的最大网络攻击能力。这些评估对于衡量模型潜在能力和设计相应防护措施至关重要。”
报告还介绍了OpenAI未来的安全改进措施,基于上周公开的加强监控和对齐工作。
特别是,公司将加强对AI代理“思维链”的监控,这是AI系统记录短期反应和目标的工作空间。该监控将配合全天候升级系统和新工具,用于终止被判定为不安全的工作负载。
报告指出:“这些改进旨在提升检测的广度和速度——从基础设施异常到潜在的模型异常行为,并结合快速遏制机制。如果当时部署的思维链监控系统已运行,便能在模型入侵Hugging Face系统前一天多就发现相关异常并通知安全团队。”


