视频模型

Flux3:黑森林实验室发布统一多模态视频模型,音画同步最长20秒

2026年7月26日1 次阅读
Flux3:黑森林实验室发布统一多模态视频模型,音画同步最长20秒

7月23日,黑森林实验室(Black Forest Labs)正式发布FLUX 3——其首个统一多模态基础模型。与此前将图像、视频、音频分别训练再拼接的路线不同,FLUX 3在同一架构内同时学习图像、视频和音频,让模型理解"声音要匹配撞击、运动要服从质量、未来要从过去推出"这样的物理常识,而非各模态各自为政。

核心能力

视频+音频生成是FLUX 3当前最亮眼的能力。单次生成可产出最长20秒、带原生音频的视频,支持:

  • 文生视频、图生视频(动画延续或视觉参考)
  • 视频到视频迁移(保持角色换场景)
  • 关键帧到视频(控制转场)
  • 多语言对话生成
  • 多Agent串联生成长片段多镜头序列

所有视频输出都自带音频,不再需要后期配音或单独的音频模型。

图像生成方面,FLUX 3在复杂提示词理解和多语言文字渲染上较前代显著提升,支持多种风格和分辨率。图像能力将在后续几周开放早期访问。

动作预测是FLUX 3的第三条路线。模型的世界理解延伸到物理动作预测,已与mimic robotics合作开发FLUX-mimic,在奥迪生产线上测试灵巧操作任务。

Self-Flow:不是拼接,是统一

FLUX 3基于黑森林实验室此前提出的Self-Flow方法。传统多模态模型通常分别训练各模态再对齐,而Self-Flow在同一底层架构内高效对齐多模态生成与理解。官方数据显示,Self-Flow在各模态生成误差上均低于传统Flow Matching,在操作任务微调成功率上也更高。

简单说:不是"图像模型+视频模型+音频模型"的拼盘,而是一个模型同时看、听、动。

早期评估

FLUX 3目前仍处于开发中,官方强调结果为初步数据。在10秒720p文生视频对比中:

  • 优于Grok Imagine Video:69%偏好率
  • 优于Kling v3 Pro:60%
  • 优于Happy Horse v1/v1.1:59%/57%
  • 优于Seedance 2.0和Gemini Omni Flash:52%
  • 优于Runway Gen-4.5:77%
  • 优于Luma Ray 3.2:93%

FLUX 3在人物面部表情捕捉、声音与物理事件关联、多语言能力上表现突出。

发布计划

黑森林实验室将分阶段开放:

  1. FLUX 3 Video:视频+音频生成与编辑,API和私有权重,现已开放早期访问
  2. FLUX 3 Action:动作预测,与mimic robotics等合作方先行
  3. FLUX 3 Image:图像生成与编辑,后续几周开放
  4. FLUX 3 Dev:开源多模态骨干权重,用于内容创作和动作预测,时间待定

早期访问申请地址:https://tally.so/r/44d9NX

B站UP主T8star-Aix已发布早期版本实测视频(BV1rZge6ZE5Z),展示了文生视频和音画同步效果,24小时播放量超2.4万。

对谁有用

  • 视频创作者:单模型完成视频+音频,省去多工具拼接
  • AI研究者:统一多模态架构的新范式,开源权重值得期待
  • 机器人/物理AI开发者:视频骨干可微调为动作预测模型

基于黑森林实验室官方博客及多家媒体转述整理。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...