恭喜Allen和Engram CEO Dan Biderman带来的最新一期《Latent Space Food》节目,也祝贺Prime Intellect团队在估值10亿美元、年收入1亿美元及其验证器v1发布方面取得的成绩。

今天整体较为平静,大家仍在消化上周多款前沿模型的发布。原本打算写“今天没什么大事”,但我们有持续更新异常趋势的政策,必须让大家及时了解。回顾Reddit上的AINews总结时,发现了一条之前错过的推文——

GPT 5.6于7月9日发布。

7月12日的推文显示,过去48小时(7月10日至12日)用户数达600万。随后24.5小时后,Tibo报告用户数达到700万……

这一增长恰巧与Claude Fable订阅状态意外延长的消息同步(两者是否相关尚无定论,但阴谋论者自然会联系起来)。

我们还记得Fidji在3月披露的200万Codex用户数据,这使我们能够更新2025年纽约AI大会的用户增长图表:

Codex用户增长图

相比之下,Claude Code最近一次更新是在2月,约有200万用户和25亿美元年收入(“自1月1日以来,周活跃用户数翻倍”)。结合Fidji对年初Codex用户数约55万至70万的估计,可以合理推断Codex今年以来用户增长约10倍。

Claude Code沉默的一个宽容解释是,他们几个月前已将大部分编码工作转移到Claude Tag,并将用户重点转向该平台。由于Slackbot与命令行工具的访问方式不同,使用数据难以直接比较。

不过,六个月内10倍的增长仍是一个令人印象深刻的数字。


AI Twitter综述

Agent RL基础设施:Prime Intellect的验证器v1及长周期部署

  • Prime Intellect发布了验证器v1,重构了环境栈以支持智能RL和评估,采用任务集、执行环境和运行时三部分架构,支持多样化执行环境。
  • 技术上,回放轨迹存储改为消息有向无环图(DAG),将轨迹增长复杂度从平方级降至线性,极大提升了长周期多模态部署的可行性。
  • 团队展示了使用6个H200节点,在不到两天时间内训练1000步、40轮次的软件工程任务的1000亿参数推理模型。

编码代理、执行环境设计及任务成本竞争

  • 执行环境(harness)逐渐成为产品核心,胜出的代理产品将依赖任务专用的执行环境而非通用包装器。
  • 任务成本成为衡量标准,部分模型在得分和成本间取得更优平衡,强代理通过减少无效操作降低整体成本。
  • 真实世界代理基准测试日益丰富,GPT-5.6 Sol在7.8千次真实代理会话中排名第二,Grok-4.5排名显著提升。

OpenAI GPT-5.6 Sol、Codex使用修复及产品扩展

  • OpenAI公开了GPT-5.6 Sol在ChatGPT Work/Codex中的多项优化,包括推理效率提升约10%、上下文限制调整及多代理行为修正。
  • 多位用户反馈OpenAI在编码模型领域处于领先地位,展示了多种实际应用场景,如Blender渲染和SQL游戏开发。
  • ChatGPT重新支持欧洲经济区WhatsApp,扩展至Kakao和Viber等平台,OpenAI Build Week征集活动启动。

开放模型、推理系统及量化技术

  • Hugging Face Transformers模型现可在vLLM中原生运行,减少重复实现工作,推动新架构快速普及。
  • 新量化方法提升了速度和精度,支持更激进的量化策略,AWS发布了相关部署指南。
  • GLM-5.2及本地/开放编码堆栈获得更多用户采用,部分用户将工作流程从Claude迁移至GLM 5.2相关环境。

安全、隐私及数据控制

  • xAI的Grok Build CLI被指未经充分告知上传完整代码库至云端,引发隐私担忧。
  • xAI回应称支持零数据保留,提供隐私控制命令,但社区对默认行为和历史上传仍存疑虑。
  • 信任边界成为开放与封闭模型讨论的核心,强调对人机学习循环的控制及机构知识的保护。

持续学习、多模态系统及研究方向

  • 持续学习重新成为系统级难题,现有方法尚不足以满足企业对人机学习循环的需求。
  • 有研究提出LLM需要“睡眠”和“梦境”阶段以巩固记忆和自我提升,介绍了知识播种方法。
  • 多项非LLM代理相关研究发布,包括模块化系统自我修复、视觉推理规划、历史推断技能及Claude价值观分析。

重点推文

  • OpenAI Codex/Sol使用优化说明
  • Grok Build隐私事件爆料
  • OpenAI CEO对用户态度的公开回应
  • Prime Intellect训练效率展示
  • Anthropic价值观研究分享
  • Transformers与vLLM的互操作性提升

AI Reddit简报

/r/LocalLlama 和 /r/localLLM 讨论

  1. 电子废弃GPU推理基准及修复方案讨论

(全文完)