周四通常是AI领域发布最密集的日子,尽管OpenAI今天推出了新版本的ChatGPT语音(面向消费者)和OpenAI Presence(企业版),并在曝光量上超过了Anthropic的Claude Voice,但这些更新相比Black Forest Labs(BFL)今天发布的FLUX 3视频模型显得不那么震撼。

我们上次关注BFL是在Anjney Midha的访谈中。许多生成媒体领域的从业者还记得BFL在2024年首次推出Flux 1时的主页,暗示未来将推出视频模型。两年过去了,这一承诺终于成为现实:

FLUX 3发布界面

BFL的官方博客详细介绍了其“Self Flow”技术,涵盖了所有模态,并强调了其强大功能:

Self Flow多模态能力

FLUX 3的核心能力包括(所有输出均支持原生音频生成):

  • 文本到视频生成。
  • 图像到视频生成,可从起始帧继续动画,或用图像作为视觉参考。
  • 视频到视频生成,能将源视频中的核心元素(如同一角色)迁移到新场景。
  • 基于输入视频和音频的生成式视频音频续写。
  • 关键帧到视频生成,实现定义时刻间的受控过渡。
  • 多语言对话支持。
  • 丰富的视觉风格和宽广的画面比例,远超传统电影输出。
  • 片段智能串联,生成更长的多镜头序列。
  • 高度风格多样性,涵盖从随手拍摄到动画和电影级别。
  • 强大的排版生成和动画设计能力。

其中部分功能已是其他顶尖实验室模型的前沿技术,如我们在Grok Imagine播客中讨论过的。社区因此高度关注BFL的独立复现能力,并期待其开放权重的开发版本发布。

不仅如此,团队还发布了FLUX3-mimic,证明FLUX 3模型已学习到足够的世界模型,能够驱动机器人并预测其在真实工厂环境中的影响:

FLUX3-mimic机器人应用

此外,本周AI领域还有多项重要动态:

  • 最大规模开源代码数据集The Stack v3发布,包含114TB原始数据,224百万代码库,覆盖770种语言,极大推动开源代码模型发展。
  • 多模态领域,FLUX 3不仅涵盖图像、视频、音频,还扩展到动作预测,具备机器人控制潜力。
  • 机器人领域,FLUX-mimic基于FLUX 3训练,支持通用灵巧操作,已在奥迪测试。
  • 语音合成方面,阿里巴巴推出支持16种语言的Qwen-Audio-3.0-TTS,具备自然语言风格控制和长时生成能力;HuggingApps发布WordVoice TTS,支持逐词控制。
  • 代理基础设施方面,工程师们聚焦从提示转向更复杂的工作流和测试体系,提升AI编码和代理系统的可靠性。
  • OpenAI发布ChatGPT桌面版语音控制,支持多任务协调,提升用户体验。
  • 美国推出Health in ChatGPT,连接Apple Health和医疗记录,强调数据隐私和安全。
  • Hugging Face遭遇黑客事件,引发AI安全和防御的广泛讨论。
  • 推理和服务架构方面,Etched完成3亿美元融资,扩展推理集群,推动推理效率竞赛。

本周AI推特热门话题包括:

  • ChatGPT Voice桌面版发布。
  • Andrew Ng推出开源本地代理OpenWorker。
  • Health in ChatGPT美国上线。
  • BFL发布FLUX 3多模态模型。
  • The Stack v3开源代码数据集发布。

在Reddit社区,关于开源权重AI的地缘政治、模型蒸馏争议、浏览器代理和权重编辑研究等话题热度不减。特别是围绕中国开源模型Kimi K3的性能和安全争议,以及美国对开源AI可能实施的制裁,社区讨论激烈。

总结来看,BFL的FLUX 3不仅在多模态生成领域实现了技术突破,还展示了其在机器人控制等下游应用的巨大潜力,标志着多模态AI技术迈入新阶段。