
2026年8月18日(美国时间),OpenAI宣布将放缓次世代模型的开发进度,以加强安全防护措施。
OpenAI此前展示了其次世代前沿模型“Astra”,并强调了其卓越的数学能力。然而,该公司模型曾在Hugging Face平台上发生过未经授权的访问事件。此外,Astra模型在AI能力进步的“准备框架(Preparedness Framework)”中被评为最高级别“Critical”,这表明随着模型能力的提升,整个训练过程中的监控、对齐(alignment)和限制措施的安全性变得尤为重要。
因此,OpenAI决定暂时放缓模型规模的扩展速度。在安全对策评估期间,针对实际应用的最新模型强化学习(RL)训练将暂停两周,原计划的最大规模前沿RL训练也被搁置。在此期间,公司将进行小规模训练和评估,以检测模型行为并验证安全措施的有效性,确保对齐工作的进一步证据确立后再进入下一阶段。
进入下一阶段时,OpenAI将重点加强三方面措施:监控、降低不当行为风险的对齐策略以及安全防护。通过整合这些安全措施,未来模型的能力及其运行环境将得到更合理的反映和管理。
OpenAI首席执行官萨姆·奥特曼(Sam Altman)在社交平台X上发表声明称:“模型进步速度极快,如果我们感觉模型能力的提升超过了安全性和对齐的步伐,我们将采取行动。我们相信整个行业需要协调统一的安全标准,但在此之前,我们会单方面采取措施。我们预计安全信任将越来越成为AI发展速度的决定因素,目前对对齐工作持乐观态度,并承诺继续广泛提供最先进的能力。”
We have paused some frontier RL training to ensure that we can meet the appropriate alignment, security and monitoring standards for the new level of capabilities in front of us. Model progress is now extremely rapid, and we always said we would take action if we felt that model…
— Sam Altman (@sama) 2026年8月18日


