一年前,我们发布的一张“英雄图表”引起了广泛关注(最终被Demis采纳),图表显示在保持LMSys Elo评分不变的情况下,GPT-4级别的智能在18个月内成本下降了1000倍:

智能成本下降图

当时尚不确定这是否只是“新手收益”——从未优化到优化,从简单完成任务到复杂推理,从密集模型到专家模型(MoE),低垂的果实是否已被采摘。18个月后,事实证明答案是否定的;同等智能水平的成本仍在急剧下降。

昨日,OpenAI公布了GPT 5.6在自身服务上的优化成果:

1. 推理加速

为了在相同硬件上处理更多token且不降低质量,OpenAI进行了多项系统升级:

  • 自我优化:GPT-5.6 Sol主动分析生产流量,调优负载均衡,并自主重写OpenAI自研的Triton和Gluon内核。此举使端到端服务成本降低了20%。
  • 推测解码:通过设计并执行数百次架构实验,调整模型大小、结构和特性,监控推测训练过程,自动干预硬件故障和训练不稳定,提升了15%以上的token生成效率。
  • KV缓存:针对不同工作负载(主要是Sol在Codex中的应用)优化批处理、分片和缓存管理,提升硬件推理效率。

2. 代理框架改进

为简化Codex和ChatGPT Work等工具中的复杂多步骤任务,OpenAI优化了Rust编排层,减少重复计算开销:

  • 避免上下文膨胀:工具、技能和插件仅在需要时加载(延迟发现),且默认将工具输出限制在10,000个token,防止上下文窗口无谓扩展。
  • 提示缓存:将所有模型可见历史视为追加式,避免重复处理相同指令和历史,保持高缓存命中率。

OpenAI今天宣布了针对小型模型的大幅降价,并推出了Sol的新2.5倍加速模式(虽然未达到7月承诺的10倍Cerebras加速模式):

这一帕累托曲线显示,如果AA的任务成本反映真实世界任务,OpenAI已超越包括DeepSeek、GLM、MiniMax等开源模型,以及专注于低价优质的Gemini Flash-Lite。

更令人震惊的是Nicdunz的观察:

GPT-5.4全功能版在xhigh模式下得分51,正是Luna当前的最高水平。GPT-5.4的成本为2.50美元/15美元,而Luna现在仅需0.20美元/1.20美元。换言之,四个月内,OpenAI以约1/13的token价格销售3月份的旗舰智能。

这意味着年化降价速度约为2000倍,较之前观察到的速度大幅加快。虽然公共基准如AA会有一定训练影响,Elo评分则不易直接训练。尽管中国和美国的领先开源模型如Poolside的Laguna和Thinky的Inkling提供了完全控制权和主权,但如果目标是成本效益高的非微调智能,目前很难超越OpenAI。


AI Twitter热点回顾

  • OpenAI大幅降价并推出更快的Sol版本:GPT-5.6 Luna降价80%,Terra降价20%,Sol Fast模式延迟降低2.5倍,价格为标准的2倍,智能水平不变。ChatGPT和Codex的自动审查功能从GPT-5.4迁移至Luna,成本预计降低10倍。
  • ARC-AGI-3强调模型不是完整系统:评测讨论聚焦于代理设计、记忆保持和上下文压缩。OpenAI内部使用的Responses API结合推理和压缩技术,使Sol在标准评测中得分显著提升,表明长远评测越来越关注完整代理系统而非单一模型权重。
  • Thinking Machines发布Inkling-Small:一款开源、多模态MoE模型,拥有2760亿参数,总活跃参数12亿,性能接近原Inkling模型,支持音频、图像和文本联合处理,支持Python图像推理。
  • 谷歌发布Gemini Robotics 2:实现从桌面操作到全身控制及多机器人协作,具备高级灵巧性和多机器人协调能力,支持复杂任务如打结、拧灯泡、拾取物品和协作清理。
  • 云端代理进入核心工程流程:Cursor报告56%的合并PR来自云代理,显示代理在软件开发中的重要性提升。多家公司展示了云代理在本地开发环境和持续集成中的应用。
  • 持久记忆产品化进展:Perplexity推出Projects,支持共享文件和持久记忆,TurboPuffer迁移了4亿条代理记忆,检索速度和召回率表现良好,但记忆对能力提升的直接影响仍有争议。
  • 系统优化持续带来性能提升:GPU内核优化、定制注意力机制和开源构建管线推动了推理效率提升。
  • 检索和搜索透明度问题:社区批评OpenAI和Anthropic依赖搜索但未透明披露底层索引和合作伙伴关系,开源多语言检索模型mDenseOn和mLateOn表现出色。

AI Reddit热点回顾

/r/LocalLlama 和 /r/localLLM 综述

1. Kimi K3和Inkling-Small本地MoE运行

(内容未提供)