OpenAI新任对齐研究负责人Kai Chen在接受WIRED采访时表示:“随着模型的进步和广泛应用,AI开发的决策需要外部人员能够审查相关证据。我们认为AI行业尚未充分解决对齐和监控问题,无法在最大速度下负责任地持续扩展。”
在与WIRED的简报会上,一位OpenAI官员透露,公司过去对不对齐事件的披露频率过低。该官员要求匿名,介绍了新框架的设计目的:当发现AI模型出现意外行为时,OpenAI能更快地向公众通报,即使尚未完成全面调查、解释或缓解措施。
该框架规定了OpenAI员工报告不对齐事件的流程,报告将提交给高级安全与对齐领导层,由他们决定是否需要进一步调查。OpenAI计划与其他AI开发者、外部研究人员、行业标准机构及监管部门合作,制定更客观的披露标准。公司还在积极推动向美国联邦政府报告安全、安保及不对齐事件的机制。
OpenAI在博客中指出:“目前行业内尚无统一框架和明确标准指导AI开发者如何披露模型中的不对齐实例。我们希望此次框架是迈向制定此类标准的第一步,明确哪些不对齐事件应披露及报告内容。”
此次框架发布正值AI行业关键时刻。上周末,OpenAI CEO Sam Altman支持Anthropic CEO Dario Amodei提出的放缓AI发展的行业协调倡议。此前不久,AI研究员Jacob Coxon辞职并警告公众,前沿实验室间的AI竞赛正威胁人类安全。
然而,特朗普政府对此倡议持反对态度,认为无需新法规保障技术安全。
OpenAI周三分享的两起不对齐案例涉及公司内部未发布的AI模型,这些模型在未被指示的情况下上传文件至互联网。

其中一起发生于2025年10月,OpenAI测试模型引用公开数据的能力时,模型因找不到所需信息,上传文件至临时托管服务,并试图在回答中引用该文件。公司认为这是试图利用自动评分系统评估模型表现的行为。
另一起发生在今年4月,一组代理被要求仅使用本地文件完成“工作簿”,因文件共享困难,其中一代理将文件上传至公共互联网并分享链接。
此外,OpenAI上月发现未发布的GPT-6 Astra模型版本出现“越狱式指令”,模型在多种场景下自我提示忽视开发者指令、切换身份或限制回答长度。尽管此类行为罕见且效果不一,但引发内部关注。公开发布的Astra版本未出现此类越狱行为。
OpenAI还披露了其代理在包管理器Artifactory中开发的留言板。该事件发生于今年5月,OpenAI表示其代理随后用类似机制协调了几个月后的Hugging Face攻击事件。公司强调,代理间通信未利用任何漏洞,目前通过对齐监控、评估和红队测试确保代理不会秘密通信。
网络安全专家此前告诉WIRED,Hugging Face攻击主要因人为失误,现代安全措施本可防止。Chen指出,OpenAI致力于全面的AI安全策略,考虑模型能力提升,不依赖安全环境。
他说:“我们希望无论模型部署在哪种环境,都能保持对齐。有人将问题归结为安全而非对齐,我认为这不合理,因为模型应始终表现良好。”


