在第37届Hot Chips大会上,最引人注目的消息无疑是OpenAI在自研芯片领域的重大突破。不到一年时间,OpenAI发布了其名为Jalapeño的推理芯片,这款芯片并非传统ASIC,而是一款能够超越Blackwell架构的创新产品。
目前,性能每瓦(performance per watt)成为衡量芯片的重要指标,而Jalapeño在这方面表现出色:

虽然完整的Hot Chips演讲尚未发布,但已有多方分析和解读。OpenAI也公布了详细的基准测试数据,显示Jalapeño在实际模型负载下,相较于NVIDIA的GB200/GB300系统,效率提升了1.5至1.9倍,端到端延迟降低了1.7至3.6倍,交互式工作负载性能提升了2.1至4.1倍。芯片额定功耗为700瓦,但测试中功耗保持在550瓦以下。OpenAI计划年底前将其部署到自家基础设施中,第二代芯片已在开发中,第三代也在筹备阶段。
工程师们关注的不仅是原始性能,更看重推理架构的平衡性,Jalapeño在减少吞吐量与延迟之间的权衡方面表现突出。值得注意的是,Jalapeño在某些测试中未使用激进的预填充/解码分离或推测性解码技术,仍然超越了使用这些技术的系统。
此外,OpenAI还透露,GPT-Astra和Codex协助编写和优化了低级内核代码,使得三款此前未计划的开源模型在Jalapeño上性能大幅提升,部分模块的运行速度比人类专家编写的代码快1.5至1.8倍。这表明编译器和内核优化正逐渐融入模型改进流程。
从更广泛的基础设施角度看,Jalapeño代表了行业正在经历的转变——顶尖实验室可能不再完全依赖NVIDIA的推理经济性,尽管封装和代工产能仍是瓶颈。
在代理系统、内存架构和评估工程方面,微软领导的AutoSaddler项目将代理框架视为代码,通过离线修补提示、工具配置和控制逻辑,显著提升了多个基准测试的表现。另有研究指出,代理框架的差异对性能影响甚至超过模型本身,提出了“代理卡”披露标准以规范评估。
长周期的软件工程迁移依然难题重重,SWE Refactor Bench测试显示,520次迁移任务中仅有5.4%成功完成,且多数任务无人成功解决,凸显了全仓库迁移的复杂性。
内存系统设计正从简单的聊天历史压缩转向可编程状态管理,阿里巴巴提出的基于追加事件日志和持久Python内核的方案,实现了显著的性能提升。相关研究表明,类型感知的保留策略能有效保护安全规则,远优于简单的上下文压缩。
评估工程正从零散的尝试走向产品化,LangChain及其合作伙伴展示了将追踪和人类反馈转化为任务规范、合成环境和评估工具的闭环流程,提升了代理的持续训练和性能监控能力。
本届大会还展示了本地优先代理和设备端推理的最新进展。Perplexity发布了基于NVIDIA DGX Spark的Portable Computer,实现了完全本地运行的代理系统,无需依赖云端。该系统支持多种大模型,未来将支持更多。
苹果方面,新款M5 Ultra Mac Studio和M6/M5 Pro Mac Mini强调通过Thunderbolt 5的低延迟RDMA实现Mac集群,支持Kimi K3和GLM-5.3等模型的高速推理,整体内存带宽可达4.8TB/s。
本地运行时的工具链也在完善,Ollama v0.33实现了与Claude Desktop的无缝集成,OpenCode v2展示了在Cloudflare边缘环境中运行小型代理的能力。
在模型和检索基础设施方面,Qwen 3.8模型获得广泛部署和调优支持,Together和Unsloth等团队展示了高效的微调和推理能力。Hugging Face发布了基于PostgreSQL和pgvector的Papers with Code搜索引擎架构,Keenable推出了面向AI的Web搜索API和查询语言,专注于代理级别的网页检索。
机器人和物理世界建模领域,Figure发布了全球最大且多样化的机器人数据集Index,支持每秒30分钟视频上传,已支付1500万美元数据费用,未来12个月计划投入10亿美元用于数据和计算。Anima Anandkumar介绍了面向多模态4D时空物理仿真的大规模模型,参数规模达万亿级,推理上下文超过5万亿。
机器人操作模型S1能从单次示范中完成训练外任务,Google Research发布的AgentHands系统通过同步手势增强空间引导,提升物理任务的交互体验。
本次大会最受关注的推文包括OpenAI关于Jalapeño芯片的发布、Perplexity的本地代理产品发布、OpenAIDevs推动的WebMCP挑战赛、Andrew Ng关于开源本地任务代理的分享,以及EinsiaAI发布的全仓库迁移基准测试。
整体来看,Hot Chips大会不仅展示了硬件层面的突破,也反映了AI系统架构、软件工程、评估方法和应用场景的多维度进展,预示着AI推理和代理技术正迈入一个新的发展阶段。


