Black Forest Labs发布FLUX 3多模态模型:20秒视频生成还带原生音频

   时间:2026-07-24 18:51 来源:快讯作者:顾青青

Black Forest Labs 宣布推出全新多模态基础模型 FLUX 3,该模型通过统一架构实现图像、视频与音频的联合学习,现已以 Early Access 方式正式上线。基于自监督流匹配框架 Self-Flow 的扩展,FLUX 3 在训练阶段同步处理视频、图像和音频数据,将生成与理解能力从 FLUX.1 和 FLUX.2 系列延伸至多模态领域。

在视频生成领域,FLUX 3 展现出显著突破。该模型支持单次生成最长 20 秒的完整视频片段,并同步生成原生音频。其功能矩阵涵盖文生视频、图生视频、视频续写、关键帧转视频等核心场景,更提供多语言对话交互与多镜头串联等高级功能。用户可通过输入视频与音频进行联合续写,实现内容创作的无缝衔接。

性能评估数据显示,在带声音的 10 秒 720p 视频生成任务中,FLUX 3 在人工评测环节取得亮眼成绩。对比 Grok Imagine Video 获得 69% 的胜率,与 Seedance 2.0 和 Gemini Omni Flash 的对决中分别取得 52% 的胜率,彰显其在多模态生成领域的竞争力。

在机器人应用方向,Black Forest Labs 与 Mimic Robotics 达成战略合作,共同探索将 FLUX 3 应用于机器人行为预测模型的可能性。这一技术融合有望提升机器人在动态环境中的决策能力,为智能体交互提供新的解决方案。

图像处理能力方面,FLUX 3 支持全流程图像生成与编辑服务。模型可处理多种艺术风格、任意宽高比及分辨率的图像需求,满足从概念设计到精细化编辑的多样化创作场景。其多模态架构确保图像生成与视频、音频模块的深度协同,形成完整的数字内容创作生态。

 
 
更多>同类内容
全站最新
热门内容