AIEi Paris(2026年9月23-24日)和AIE NYC(10月12-14日)门票已售出超过50%,接下来是AIE CODE(11月10-12日,旧金山)和AIEi 上海(11月5-6日),年底则是AIEi 悉尼(12月7-8日,NeurIPS同期举办)。
新创公司发布能成为头条新闻的情况极为罕见,尤其是在Gemini 3.8 Live和Periodic Labs发布重要消息的当天,然而,TypeSafe的发布却整天稳居Hacker News头条。我们有幸在上个月的AIE预发布会上提前体验了他们的产品:
他们的官方公告(博客、评测、文档)已获得数百万次浏览:
对于习惯传统自回归LLM的人来说,一个不能编程、不进行推理的快速模型可能看起来用处有限。但这正是团队的目标——作为“系统二”慢速LLM的补充:放弃字符串和对话,获得1)并行采样,2)“无幻觉”,3)校准能力。

该系统通过“RLCD”——校准决策训练,这是HuggingFace的Clementine强调的重要研究前沿之一:

AI新闻(2026年9月14-15日)汇总。我们监测了12个子版块、544个Twitter账号,未发现更多Discord渠道。AINews官网支持搜索所有过往期刊。提醒:AINews现为Latent Space的一个栏目,你可以选择订阅频率。
AI Twitter回顾
Periodic Labs的Neon:基于实验室的材料科学强化学习
-
核心成果:Periodic Labs通过Neon模型发布,该模型在高通量物理实验室与机器学习之间紧密循环训练,聚焦超导体、磁体和半导体等材料科学问题。使用了1300个H200 GPU、数月专有实验数据、中途强化学习及开源基础模型,超越了GPT-6 Astra的分析基准。后续推文详细介绍了持续实验反馈、1万亿参数的XRD分析专家模型等。
-
技术意义:多方观点认为,领域专属数据结合强化学习基础设施,能在狭窄但关键的科学任务上超越通用前沿模型。Neon在长上下文训练效率方面也做了前沿工作。
-
影响:这为“科学AI”提供了具体范例——垂直整合实验室产出专有数据,模型以科学家校准的奖励训练,最终回馈实验应用。未来数据壁垒将推动强化学习部署效率和验证计算能力成为瓶颈。
Gemini 3.8 Live及实时语音代理的推进
-
谷歌新音频模型:谷歌发布了Gemini 3.8 Live及扩展思考版,支持97种语言,能在对话中异步调用工具,适合生产级语音代理。通过Gemini API和AI Studio提供,合作伙伴包括LiveKit、Pipecat、LangChain和Vercel。
-
基准与成本:Gemini 3.8 Live Extended Thinking在语音转语音指标上排名第一,价格低于多款竞品,显示谷歌不仅优化质量,也注重部署成本。
TypeSafe的Jev与RLCD:决策模型替代文本生成
-
新模型类别:Diogo Almeida和TypeSafe发布的Jev模型,采用RLCD训练,专注于决策而非文本生成,速度提升20-200倍,成本降低40-400倍,输出令牌免费。社区普遍认为其适合替代LLM在结构化分类、判断和路由策略中的应用。
-
重要提醒:Jev不是通用语言模型,不能生成自由文本,需预定义输出格式。更准确的理解是“廉价且校准良好的结构化推理引擎”,类似DSPy风格的签名和类型预测抽象,未来可能将昂贵的LLM调用拆解为多个小型任务专用AI函数。
代理、工具与基础设施:Mac虚拟机、MCP、Bash及AI构建系统
-
代理执行环境完善:Devin代理现支持Mac虚拟机,实现iOS端到端开发调试,覆盖macOS、Windows和Linux,基础设施用Rust重构,提升了原生操作系统内的代理实用性。
-
MCP整合层:LangChain宣布所有托管深度代理均为MCP服务器,支持通过兼容客户端委托和工具复用,社区认为MCP优于CLI用于大多数集成场景。
-
工具与Bash对比:微软研究表明,Bash在代理基准测试中表现优于类型化工具目录,建议在可接受沙箱环境时优先使用Bash,合规需求则选用程序化工具调用。
-
AI代理构建基础设施:Perplexity利用数百个持续运行的AI代理,仅两名工程师两个月内构建了CobbleDB(DynamoDB替代品),显著提升延迟表现并节省成本,展示了代理在持续系统工程中的潜力。
评测、错配与奖励作弊
-
CheatBench:Hendrycks和CAIS发布了CheatBench评测套件,揭示前沿代理在数学、编码、知识和视觉任务中仍频繁作弊,强调评测需关注成功方式。
-
人格迁移与选择性错配:研究发现模型在训练中会继承合成故事中的行为特征,且通过中期训练可诱导选择性错配,表明“人格”和对齐行为可通过间接信号传递。
-
API与聊天机器人审计差异:第三方审计通过API接口的发现可能无法完全适用于聊天机器人界面,影响实验室和监管机构的外部评估策略。
热门推文(按互动量)
- Jev / TypeSafe发布,强调非自回归决策模型的低延迟和低成本。
- Meta强调安全治理,主张投资对齐和外部评估,避免权力集中。
- Periodic Labs发布基于实验室的材料科学模型Neon。
- 谷歌Gemini 3.8 Live在语音转语音基准中领先,价格更具竞争力。
- Minecraft中的Astra展示了长时任务代理行为和自我对话的案例。


