随着Sama继续推进“伟大节奏”,Etched成为双独角兽,Cerebras宣布CS4可支持10万亿参数模型以每秒1000个token的速度运行,内存短缺问题自今年2月我们进行半导体分析以来依然未见缓解。

根据Tom’s Hardware报道:

我们正处于极其严峻的局面。如果你关注这个领域,应该已经意识到内存价格已经完全脱离了现实。有人称之为“内存末日”,我更喜欢称它为“内存灾难”。

目前128GB DDR5套装的价格是历史最低价的十倍。

情况如此严重,以至于超大规模买家据称已经锁定了2027年几乎所有全球DRAM产能,并支付预付款以确保供应。如今,主流DRAM芯片的每公斤价值超过了实心黄金的一半。

内存价格走势图

换句话说,推动硬件单价持续下降的著名摩尔定律在内存领域被逆转了。

AI领域最新动态回顾

OpenAI前沿强化学习暂停及安全监控加强

  • OpenAI宣布暂停部分前沿强化学习训练两周,强化安全和对齐措施。Sam Altman表示能力发展已超出安全准备,Greg Brockman强调安全信心将决定前沿扩展速度。
  • OpenAI公开了更具体的实施细节,包括更强的工作负载和网络隔离、持续安全测试及多阶段监控。监控可能增加约20%的开销,采样token监控能在约30分钟内通知安全团队。

开放模型进展与小模型争论

  • Qwen3.8-27B成为本地可运行前沿模型的焦点,表现优异但在实际编码应用中存在争议。
  • 本地可用的部分去除限制的模型开始出现,显示出实用性和部分解禁的趋势。
  • GLM-5.3通过后训练技术显著提升性能,表明智能体能力提升正从参数规模转向强化学习系统和环境质量。

推理与系统基础设施更新

  • Mojo语言正式开源,提供跨加速器的硬件抽象层。
  • NVIDIA发布TensorRT Model Connect,简化模型部署流程,支持直接转换Hugging Face模型至TensorRT推理。
  • Cursor分享了大规模Git存储设计经验,强调Git托管已成为AI基础设施关键依赖。
  • 推理速度持续提升,Cerebras CS-4支持10万亿参数模型以1000 token/s速度运行,推理速度成为产品体验和国家竞争力的重要因素。

代理框架、评估与生产反馈

  • Miles v0.1发布,作为开源强化学习框架支持多模态大模型,强调调试和规模管理的重要性。
  • 搜索基准测试成熟,表明优化搜索策略可降低整体任务成本。
  • LangSmith推出专门评估器,推动评估从预发布检查点转向持续数据挖掘。
  • 多款工具和平台强调代理框架成为实际产品的关键,模型质量之外,框架决定了实用性。

研究笔记

  • 多代理团队通信研究显示,协调者命名并不总能提升效果,任务结构影响通信拓扑,使用共享文件可显著减少消息量。
  • 训练中的浮点运算顺序和分片差异导致的变异性接近传统初始化和数据顺序变异,提示单次训练结果不足以作为定论。
  • 公共AI观察站启动,公开透明地测量AI助手使用情况,涵盖数万对话和多模型数据,推动AI使用模式的公共利益可观测性。

热门推文

  • Sama关于暂停前沿强化学习训练以加强安全对齐。
  • AnthropicAI关于Claude自主设计蛋白质结合器。
  • OpenAI详细说明两周暂停及新安全监控措施。
  • Cursor关于将Git存储设计为数据库以提升可靠性和规模。
  • Claude开发团队关于Gmail和Google Drive集成功能。
  • Z.ai发布GLM-5.3 API,支持编码、网络安全和长远智能体。

AI Reddit社区动态

/r/LocalLlama 和 /r/localLLM 综述

Qwen 3.8 27B基准测试与调优

(内容待补充)