OpenAI刚刚发布了GPT-6 Astra,短短9小时内就获得了3600万次浏览和16.4万点赞,成为自Sora以来最成功的发布,甚至超过了GPT-4和GPT-5的影响力。

此前,Anthropic的产品发布通常更受欢迎,但这次OpenAI首次扭转了局面,赢得了更高的关注度。

OpenAI将Astra定位为“迄今为止最智能且最符合价值观的模型”,重点提升了计算机使用、软件工程、数学科学、办公文档处理和网络安全能力。发布初期面向有限组织,随后逐步向ChatGPT Plus/Pro/Business/Enterprise用户、API及AWS开放。
发布过程中出现了延迟、博客发布问题以及访问时间不明确等问题,引发部分用户不满,尤其是付费用户无法第一时间使用,而部分影响者获得了优先体验。为此,OpenAI为受影响的付费用户提供了“补偿重置”服务。
系统卡片和安全部署材料显示,Astra在提升对齐度的同时,降低了链式思维(CoT)的可监控性,这引起了业界广泛关注和讨论。
在性能基准测试方面,OpenAI及其支持者称Astra实现了“类AGI”的飞跃,但独立评测机构和部分研究者认为其提升虽显著但不均衡,尤其在成本和非精选评测中表现复杂。
Astra在计算机使用、3D生成与重建、游戏开发、长远知识工作及科学推理方面表现突出,获得了多方好评;但在监控能力、评测意识、发布治理及基准饱和度方面也存在争议。
官方公布的具体规格包括:
- 价格标准版为每百万输入token 10美元,输出token 50美元;快速版价格为输入20美元,输出100美元,速度提升2.5倍。
- 新增异步函数调用、中途调整推理力度等API功能。
- 在多个基准测试中表现优异,如ARC-AGI-3达到99.9%,FrontierMath Tier 4达到98%,ExploitBench满分。
独立评测机构如Artificial Analysis、ARC Prize、Epoch AI、Perplexity等均发布了详细数据,显示Astra在编码效率、智能指数、事实准确率及长远知识工作上有显著提升,但也存在部分性能回退。
发布引发了多种观点:
- 积极派认为这是一次真正的代际飞跃,强调其在计算机使用、3D推理和科学工作流的突破。
- 中立派认为虽然进步明显,但基准测试结果复杂,成本效益需综合考量。
- 怀疑派认为发布被过度炒作,部分基准表现不及竞争对手。
- 安全关注者警示能力提升伴随监控难度加大,可能带来风险。
- 对发布流程和治理提出批评,认为“无法使用就不能称为发布”。
技术上,Astra将“计算机使用”作为核心能力,支持异步函数调用和中途推理调整,提升了模型的实用性和灵活性。其不透明的推理能力引发了安全和监控方面的担忧。
此外,Astra在3D视觉、多模态空间推理、数学科学及网络安全领域均有创新表现,推动了AI应用边界的拓展。
发布时机紧跟Anthropic Fable 5.1,明显是OpenAI对竞争的回应。尽管发布过程存在摩擦,但OpenAI强调背后大规模计算和系统创新。
更广泛来看,基准测试正迅速饱和,评测方式和模型能力的界限变得模糊。AI前沿已从简单的聊天和编码扩展到计算机操作、多模态推理、长远规划、科学证明及网络攻防等多领域。
安全评估也从简单的拒绝率转向对模型内部推理的监控和控制能力,Astra的发布将这一问题推向了风口浪尖。
成本方面,虽然每token价格上涨,但由于效率提升,部分任务的整体成本反而降低,促使业界更多关注“每任务成本”而非单纯token价格。
关于“AGI”的讨论更加分裂,支持者认为广泛的专业级能力足以称之为AGI,怀疑者则认为尚未达到人类般的通用智能,安全专家则更关注模型的可控性和监控性。
此外,AI生态系统和基础设施也在快速发展,NVIDIA收购Hugging Face引发了对开放模型生态的热议,多个开源项目和工具持续推动行业进步。
总的来说,GPT-6 Astra的发布不仅代表了技术上的重大进步,也引发了关于AI能力、安全、成本和治理的广泛讨论,标志着AI发展进入了一个新的阶段。


