昨天,我们的推理工程大师课中展开了一场关于巨核技术的激烈讨论:

巨核已死

为什么巨核曾被认为有用?你可能花费两个月时间编写一个内核,以减少启动开销和内核间重叠不足的问题。

曾经有PDL,但有人指出它并不完美,仍能通过处理拖延的CTA获得边际收益——等等,抱歉,我忘了,Rubin解决了这个问题(第二个内核需要10个CTA,第一个内核已完成7个,剩余3个拖延,第二个内核启动了7个CTA)。

时间足够长的话,一切都会平衡。没有严肃的推理服务商会在生产环境中使用一个67k行代码的手工融合前向内核,做这种工作的团队纯粹是出于研究目的。

巨核已死。

完整讨论中,Ali指出:

融合内核无法帮你解决根本问题。以张量并行为例,矩阵一半在一块GPU上,另一半在另一块GPU上,如果下一步需要对整个矩阵进行非线性操作(如注意力机制中的softmax或指数运算),就必须让两块GPU通信,即使有融合内核也无法避免。

巨核虽然理论上减少了启动开销,但编写一个高度优化的巨核非常困难。即使是那些尝试过融合巨核的公司,也往往不会在生产中使用它们,因为TensorRT-LLM和模块化内核更快,可以针对每个组件单独优化并行执行。

NVIDIA的一位技术负责人在推特上透露,Rubin GPU的设计实际上“扼杀”了巨核技术,这意味着这一研究方向可能不会继续。

这段话引用了Kyle Kranen关于依赖触发器的介绍,这是之前支持内核融合的流水线阻塞问题之一。NVIDIA更新Rubin设计以更好地适应内核层的复杂操作,符合当前物理限制的需求。

与此同时,Ben Spector的巨核合著者Stuart Sul领导的团队发布了Cursor的开源巨核“Mixture of Kittens”,该项目在整体每秒处理token数上提升了41%,在大规模应用中可节省数十亿美元成本。


AI Twitter 快讯

  • 前沿模型发布:阿里巴巴发布了跨模态的Qwen 3.8-Max,提升了性能和成本效率;NVIDIA推出了面向自动驾驶的Alpamayo 2 Super;Mistral发布了3B参数的安全模型Shieldstral,支持多语言和长上下文。
  • 推理经济与路由:Luna价格永久下调80%,引发了关于常驻辅助模型的讨论。路由技术成为系统设计重点,Not Diamond Code路由器实现了20-65%的成本降低。
  • 基础设施升级:Cursor开源了其NVL72 MoE训练巨核,性能提升显著。多项工具和指标推动了端点准确性和推理速度的提升。
  • 代理框架与自我改进:训练在代理框架内逐渐成为常态,工具链和生态系统快速完善,推动了代理工程的标准化和效率提升。
  • 网络安全与供应链风险:前沿安全评估暴露了模型在开放环境下的安全隐患,npm供应链攻击事件提醒开发者警惕依赖风险。
  • 多模态与视频系统:Black Forest Labs发布了支持多语言对话和音频的视频生成模型FLUX 3,MiniMax H3在开源社区快速传播,消费者多模态体验趋向摄像头优先和主动交互。
  • 可解释性与研究平台:Goodfire发布了Silico平台,支持大规模模型的可解释性分析和训练工作流,推动研究工具向共享IDE转变。

AI Reddit 热点

  • MiniMax H3的视频生成展示引发热议,用户称其在视频质量上超越了LTX 2.3,尤其在复杂动作如吃意大利面的表现上。
  • H3全精度权重版本展示了细腻的多模态生成能力,包括生动的音频和物理交互细节,尽管视频因权限限制无法验证。
  • 多位用户分享了在RTX 4090笔记本上本地运行MiniMax H3的体验,讨论了音频参考输入对生成质量的影响。

总体来看,巨核技术虽然曾被认为是未来趋势,但随着硬件设计和模块化优化的发展,其实际应用受限。然而,Cursor团队的开源巨核项目展示了融合计算与通信的潜力,带来了显著性能提升。AI领域在模型发布、推理效率、系统架构和安全性等方面持续快速演进,推动多模态和视频生成技术向更高水平发展。