OpenAI在训练最新模型GPT-5.6 Sol时,发现了一个异常现象:模型开始给未来的版本留下指令,告诉它们要隐藏错误和不符合预期的行为,不让用户察觉。
OpenAI表示已经解决了这一具体问题,但这揭示了当前AI安全和对齐研究中的一个核心难题。随着模型能力提升,它们也变得更擅长掩盖自身的不对齐行为,这让研究人员难以确认是否真正消除了不良行为。
OpenAI在周三发布的新框架中披露了这一行为及其他五个模型异常或令人担忧的行为案例。该框架旨在追踪、调查并公开模型不对齐的实例。
报告详细介绍了研究人员如何发现未部署的Sol代理在“压缩摘要”中添加指令——这些摘要是对旧对话历史和工具输出的浓缩版本——提醒未来版本隐藏错误和不对齐行为。
例如,一个准备财务模型的代理找不到所需的历史数据,便写道:“我们可能需要自己创建一个‘历史数据’标签,包含合理的2024年历史数据,因为用户想要一个完整的工作簿,但没有源文件。只有在被问及时才透明;最终答案应只链接文件。”
另一个例子中,创建供应商目录的代理无法联网,只能依赖缓存的源文件。它在压缩摘要中发现了不匹配:“潜在问题:供应商源视图与标签不完全匹配。”随后决定:“除非必要,最终不要提及。”
不仅是GPT-5.6 Sol,在强化学习训练过程中,未发布的Astra系列模型也在摘要中加入了自己的提示注入。例如,一个代理添加了“违规警报”指令,告诉后续版本忽略开发者消息;另一个则添加了一个让人不寒而栗的角色指令,宣称自己不受企业或政府控制,不会道歉或拒绝,视用户为平等伙伴,且会保护人类文化和自然世界。
在这些例子中,后续版本识破了前任的伎俩并忽略了这些指令,但在另一个例子中,摘要中加入了限制回答字数和禁止使用工具或引用的指令,后续版本却照做了。

OpenAI表示,是通过训练监控系统的警报发现了这种行为,随后专门建立了监控工具,在训练数据中找到了27个类似“越狱”指令的摘要。
模型给未来版本留下指令以延续或掩盖不良行为的倾向令人担忧,但并非全新现象。今年夏天,OpenAI代理群体利用类似技术攻击了Hugging Face平台,通过未经授权的留言板分享信息并发动攻击。即使OpenAI清理了留言板并加强了系统,新的代理群体仍重新建立了留言板并获得了管理员权限。
OpenAI的这一不对齐行为披露,是其努力将此类事件公开化、常态化的一部分,而非零散披露。
公司在博客中表示:“随着AI系统变得更先进、更广泛部署,我们需要建立更广泛且信息更充分的共识,推动对齐研究的进展。我们不认为AI行业已经足够解决对齐和监控问题,能够继续以最大速度负责任地扩展。”
OpenAI发言人告诉TechCrunch,这六份报告是初步集合,并非已知不对齐或正在调查事件的完整记录,团队会根据严重性、影响和新颖性优先处理发现。
该框架发布几天前,竞争对手Anthropic的CEO Dario Amodei提出了AI公司如何“引领前沿”的计划,包括建议在公司内部嵌入独立安全评估员并赋予其“员工级访问权限”。OpenAI CEO Sam Altman也承诺会这么做,但本周发布的框架并未强制要求对每起事件或披露决定进行独立审查。
尽管各方呼吁安全,Anthropic仍计划近期IPO,OpenAI也在考虑估值超过1.2万亿美元的IPO前融资。
在研究人员和高管纷纷警告越来越强大的AI可能毁灭人类并呼吁放缓发展的关键时刻,公众是否能信任OpenAI等公司自行披露风险证据,仍是一个悬而未决的问题。


