2026年8月19日,Black Forest Labs(BFL)正式发布FLUX 3——一个基于Self-Flow架构的统一多模态基础模型,在单一架构内同时学习图像、视频、音频和动作预测。FLUX 3不只生成像素,还构建对物理世界的理解:声音必须与冲击匹配,运动必须服从质量,未来必须承接过去。这是BFL这家由Stable Diffusion原创始团队创立的柏林AI实验室,在2024-2026年间从FLUX.1图像模型,一路演进至FLUX.2、FLUX Kontext,直至今天发布的FLUX 3多模态统一模型。

一、20秒视频+原生音频:一次生成同时产出画面与声音
FLUX 3 Video是当前发布的核心能力。用户可以用一段文字提示词,直接生成最长20秒、1920×1088分辨率、24fps的超清视频片段,且视频默认包含原生同步音频——不是后期合成,而是音频与画面在同一次生成中完成。传统工作流需要先生成视频,再单独调用TTS或音乐生成工具,最后手动合成音频轨道,FLUX 3把这个流程压缩为单次API调用,音频生成与视频帧生成同步进行,声音与画面天然对齐,无需后期调校。
支持的生成模式包括:纯文字生成视频(Text-to-Video)、以图片为起点生成或动画化视频(Image-to-Video)、以已有视频片段为参考生成新内容(Video-to-Video)、通过关键帧控制视频过渡(Keyframe-to-Video),以及多片段串联成长视频(Agentic Chaining)。每种模式都可以通过同一个API端点完成,只需在请求体中指定mode参数即可切换。
二、技术架构:Self-Flow如何统一多模态学习
FLUX 3的核心创新在于Self-Flow架构。与分别训练图像、视频、音频模型再进行跨模态对齐的传统路线不同,Self-Flow让所有模态在同一个transformer框架下联合学习,通过流匹配(Flow Matching)机制实现不同模态表示空间的自然对齐。这使得FLUX 3在物理一致性上显著优于竞品:声音与画面冲击点精确同步,运动轨迹符合质量与惯性定律,生成内容具备真正的多模态一致性。
三、商业影响:从单点工具到多模态内容基础设施
FLUX 3的发布对AI内容创作生态具有深远影响。对于游戏开发者,可以用一段文字描述直接生成带音效的过场动画;对于广告团队,一条Prompt即可产出完整的视频广告素材;对于教育内容创作者,可以更高效地生产可视化教学视频。随着API的开放和更多开发者接入生态,FLUX 3有望成为多模态内容生成的新基础设施,也将推动整个AI视频行业向原生多模态时代迈进。


