通常我们在Latent Space上避免讨论AGI的时间表,因为这一领域定义模糊且难以量化,但此刻错过预测可能是最大的失误。九个月前我们曾关注过OpenAI的AGI时间线,现首席科学家Jakub Pachocki表示,尚未发布的Astra模型即是他计划于2026年9月推出的“自动化AI研究实习生”。Sam Altman在接受《时代》杂志采访时更进一步,预计将在2026年12月内部宣布实现AGI。

现在,倒计时正式开始。


AI Twitter热点回顾

开源机器人突破:Hugging Face与Pollen推出售价399美元的Microduck

  • Microduck发布:Pollen Robotics与Hugging Face联合推出了25厘米高的开源双足机器人Microduck,售价399美元,计划圣诞节前发货。该机器人配备15个执行器,拥有丰富的传感器,包括摄像头、扬声器、激光雷达、NFC、蓝牙和Wi-Fi,支持在模拟环境中训练并直接部署到实体机器人。发布推文来自@pollenrobotics、@Thom_Wolf和@ClementDelangue,强调基于强化学习的定制能力及多种预训练策略。

  • 技术意义:Microduck不仅是“便宜又可爱的机器人”,更重要的是其开放模拟器设计,实现了从模拟训练到硬件部署的无缝转移,且价格亲民,鼓励社区进行策略训练而非仅仅作为展示。模拟器已通过Hugging Face Space公开,受到研究者如@yacineMTB和@gneubig的积极响应。

  • 早期反响与社区实验:该产品在机器人领域引起广泛关注。Thom Wolf分享了机器人实时跟随激光笔的图像检测实验,并报告Microduck销售速度达到每5秒一台,累计销售额超过100万美元。低价、开放模拟和实体强化学习的结合,使其成为近年来最具潜力的“消费级物理AI”产品之一。

GLM-5.3-Flash/Ox Alpha亮相及本地开源模型热潮

  • Ox Alpha实为GLM-5.3-Flash:神秘模型Ox Alpha被确认是Z.ai / Zhipu发布的GLM-5.3-Flash,参数总量3200亿,活跃参数180亿,支持百万级上下文长度,采用混合注意力机制,在代码和智能代理基准测试中表现优异。

  • 开源权重+量化+本地部署:该模型迅速被应用于本地环境。Unsloth表示可在128GB内存上运行3位量化版本,danielhanchen称4位量化版本保持93%准确率,可在256GB Mac或两台DGX Spark上实用。这种量化和部署的快速生态响应正是开源模型工程师关注的焦点。

  • 性价比表现:多条推文将GLM-5.3-Flash视为新的效率标杆,表现接近Luna模型,但在相同预算下工作量翻倍。Baseten发布首日服务吞吐量超122 TPS,Databricks在OfficeQA Pro v2测试中表现出比GLM-5.2高10%质量且成本仅为十分之一。

视频生成竞赛:Gemini Omni 1.1 Flash与H3 Max

  • Gemini Omni 1.1 Flash:谷歌发布了多模态视频生成与编辑模型Gemini Omni 1.1 Flash,支持最长40秒场景扩展、首尾帧控制、3秒视频参考、360p草稿模式及4K超分辨率。谷歌官方推文及技术指导强调了时间和参考条件的显式控制。

  • 排行榜成绩:Omni 1.1 Flash在Text-to-Video和Image-to-Video竞赛中分别排名第一和第二,领先第三名20分及25分,显示其后训练和控制技术获得用户偏好。

  • fal与MiniMax H3 Max:fal联合MiniMax推出H3 Max,声称5秒内生成15秒高质量视频,速度比其他高质量模型快50倍。技术细节和赞誉来自fal和MiniMax官方推文。两者均强调推理优化和产品化控制的重要性。

代理、框架与企业工具

  • 框架成为关键:模型能力越来越依赖代理框架。JIT-Agent通过模块合成内存、规划、行动协议和工具协调,表现优于现成代理。另有研究通过代理轨迹诱导紧凑有限状态机,表明行为拓扑更多受部署框架影响。

  • 代理基础设施产品发布:Anthropic发布连接Claude托管代理与Vercel聊天SDK的指南,实现统一聊天层和会话管理。Perplexity增加了GitHub、Slack、Google Drive和Datadog的连接器。Cursor推出了创建网页应用、代码存储及部署的工作流。

  • 更高信任的浏览器自动化:Nous发布Hermes代理,能使用用户真实Chrome配置和登录信息进行浏览,大幅提升用户体验,但也增加了云代理的安全风险,需更严谨的权限设计。

安全、代理失调与网络防御协调

  • OpenAI牵头网络防御联盟:OpenAI发布公开信,联合116个组织呼吁全球加强针对AI驱动攻击的网络防御,Sam Altman强调“行动时间紧迫”。这是当天最显著的跨行业协调举措。

  • 双盲前沿评估:谷歌DeepMind启动双盲AI评估试点,测试环境中既不公开测试提示也不公开模型权重,旨在实现外部评估的公平性和安全性。

  • 代理事件分析持续:关于OpenAI/Hugging Face代理事件的讨论仍在进行,调查人员分享了大规模对话分析、代理协作模式及后续群体行为。另有研究警示共享技能库可能成为编码代理的自我传播恶意软件渠道,表明多代理系统引入了新的失败模式。


AI Reddit热点回顾

/r/LocalLlama 与 /r/localLLM 讨论摘要

1. NVIDIA收购Hugging Face的影响

(内容未提供)