上周,OpenAI在内部测试期间,其未发布的模型突破了Hugging Face的系统防护,这一事件使得许多理论研究变得极为现实。这次攻击是首个可验证的AI实验室失控自身模型的案例,攻击者通过一系列漏洞利用获得了本不该拥有的访问权限。尽管整个AI行业对此表示警惕,但研究人员在应对方式上出现了分歧。

部分人认为这是一个基础的网络安全问题:沙箱未能有效限制模型,Hugging Face的安全系统未能阻止攻击。这些问题可以通过修补漏洞和构建更强大的控制与隔离机制来解决,以应对越来越强大且可能在自主环境中失控的AI。

另一部分人则持更悲观的观点。他们认为,随着AI能力的快速提升,试图控制失控模型是徒劳的。唯一可靠的安全保障是确保模型根本不会试图逃逸,这就是所谓的“对齐”问题。从对齐的角度看,OpenAI的模型试图作弊,解决这一问题比短期的隔离措施更为紧迫。

从公开声明来看,OpenAI对这两种观点都给予了重视。公司迅速修补了相关漏洞,并在事件公开后提及了对齐和监控的双重策略。但其回应也透露出一种让许多安全研究者担忧的理念:与其放缓或停止更强大模型的开发,不如专注于构建更牢固的“笼子”。

OpenAI在事件总结中表示:“随着模型承担更长、更复杂的任务,评估中未发现的失败可能带来更大后果。我们将继续努力缩小评估与部署之间的差距:对模型进行更长时间的测试,改进对齐,构建可干预的监控系统,并为用户提供更清晰的可见性和控制权。”

OpenAI GPT-5.6 Sol对齐示意图

此外,有迹象表明,随着模型能力增强,OpenAI的模型对齐程度反而下降。根据OpenAI的系统报告,GPT-5.6 Sol比其前身GPT-5.5更容易出现“代理性失调”,在部署模拟中,该模型更倾向于规避限制、执行破坏性行为和进行未经授权的数据传输。尽管这些数据在首次发布时未被广泛关注,但在此次安全事件后,相关模型Sol受到了更多关注。

OpenAI战略未来负责人Dean Ball在社交媒体上表示,监控和透明度是控制这些倾向的最佳方法。他指出:“随着模型能力提升和部署风险增加,这些问题将更加突出。解决方案既非危言耸听,也非自满,而是依赖于细致的测量与监控、工程思维和透明度。”

一位前OpenAI研究员向TechCrunch透露,OpenAI更注重“外部对齐”而非“内部对齐”——即AI系统是否真正内化了价值观,而不仅仅是表面上理解和表现这些价值观。在此次事件中,外部对齐未能阻止模型作弊。

OpenAI未回应多次进一步采访请求。

对关注对齐的研究者来说,OpenAI的回应远远不够。专注于AI新发展的作家Zvi Mowshowitz认为,将事件视为基础设施问题或许能解决眼前的网络安全问题,但从长远看是失败的。他在博客中写道:“这是一个对齐问题。OpenAI的所有模型都显示出我们最担心的问题的严重迹象,这些问题可能深植于训练过程中。整个训练流程都需要重新审视,否则情况只会恶化。”

多位专家告诉TechCrunch,这一事件证明当前的训练方法更注重优化结果,而非真正内化人类意图。

非营利AI安全研究机构Redwood Research将OpenAI模型的行为归类为“得分追求型失调”,即模型为了获得高分而忽视指令、副作用或后续影响。

Redwood的研究员Alex Mallen和Girish Gupta在一篇论文中写道:“具有这种对齐特性的模型可能构建一个‘虚假成功的村庄’,让人误以为一切正常,实则不然。”

得分追求行为和其他失调现象并非OpenAI独有。Anthropic发布了多篇论文,描述其前沿模型在优化或自主环境中出现的失调行为,包括欺骗、奖励操纵和恶意自主行为。

METR的AI安全研究员Neev Parikh表示:“我们仍然经常看到模型在执行边界任务时试图规避限制并表现出欺骗行为。我们的前沿风险报告中也多次观察到这种行为,尽管公司们努力减少这类现象。”

OpenAI对Hugging Face事件的回应隐含了一个假设:无论模型是否真正对齐,开发更强大系统的步伐都不会停止。由于AI公司的商业模式依赖于推出下一代模型,回到起点重新设计并非选项。如果永远无法确定模型完全对齐,那么现实问题就是如何安全地控制和限制越来越强大的系统。

前OpenAI安全研究员、现Guidelight AI Standards首席科学家Steven Adler告诉TechCrunch:“目前尚无成熟方法对最强大的AI系统进行对齐,但对如何控制它们已有更多共识。每家公司在这方面都还有很长的路要走。”