大数跨境

Black Forest Labs发布Flux 3!初评超过Seedance 2.0,将开源

Black Forest Labs发布Flux 3!初评超过Seedance 2.0,将开源 AIGC开放社区
2026-07-24
1
专注 AIGC 技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦 LLM 及 AI 技术的市场研究和开发者生态。

开源图像模型领域的领军者 Black Forest Labs(黑森林实验室)正式发布 FLUX 3。此次升级标志着该模型从单一的图像生成工具,进化为集视频、音频、动作预测于一体的多模态统一模型。FLUX 3 以多模态流模型为基石,实现了对视觉、听觉及物理世界的综合理解。

Black Forest Labs 成立于 2024 年,由三位前 Stability AI 核心研究人员创立,他们曾共同开发了著名的 Stable Diffusion 模型。凭借开源高质量的 Flux 1 模型,该公司迅速在业界崭露头角。随后的 FLUX 2 引入“流匹配”(Flow Matching)技术与 Transformer 架构,在提升画质的同时显著降低了推理成本。而最新的 FLUX 3 则实现了多模态统一,不仅能处理图文音视频,还具备动作预测能力,为机器人等物理 AI 应用奠定基础。

公司融资进展迅猛,已晋升为独角兽企业,累计融资超 4.5 亿美元。2025 年 12 月完成的 B 轮融资达 3 亿美元,投后估值高达 32.5 亿美元,投资方涵盖 Nvidia、Salesforce Ventures、Andreessen Horowitz (a16z) 等顶级机构。

全感官统一:一个模型学习所有模态

过去几年,生成式 AI 领域往往将图像、视频、音频割裂开发。Black Forest Labs 认为这种路径存在局限。图像捕捉空间结构,视频揭示时间维度与物理规律,音频暴露因果关系,而语言则连接感知与抽象概念。单独训练单一模态仅能得到局部最优解,而联合训练所有模态,利用它们之间的相互约束(如声音需匹配撞击力度、运动需遵守质量守恒),能让模型更深刻地理解底层现实。

FLUX 3 正是基于这一原则构建的首个模型。技术上,它依托 Self-Flow(自流)方法,将多模态生成与理解高效对齐至同一底层架构,并通过扩展算力与数据,同时在视频、图像、音频上进行训练。

数据显示,相较于传统的 Flow Matching(流匹配),Self-Flow 在生成误差(Fréchet 距离)和任务操控成功率上均表现更优。

视频生成:原生音频与全能表现

FLUX 3 具备强大的视频生成能力,单次可产出分辨率达 720p、时长最长 20 秒且带有原生音频的视频。其核心功能包括:

  • 文本生成视频;
  • 图像生成视频(支持起始帧延续或视觉参考);
  • 基于参考片段的视频重绘,将源视频角色迁移至新场景;
  • 视频 - 音频的生成式延续;
  • 关键帧控制,实现特定时刻间的可控过渡;
  • 多语言对话支持;
  • 广泛的视觉风格与宽高比适配;
  • 自主串联独立片段为多镜头长序列;
  • 极高的风格多样性,涵盖手持摄像、动画及电影质感;
  • 强大的字体生成与动态设计能力。

早期评估数据(10 秒、720p、带音频)显示,FLUX 3 在与主流模型的对比中占据压倒性优势:

具体偏好率如下:对阵 Gemini Omni Flash 和 Seedance 2.0 获 52% 优势;对比 Happy Horse 两版本、Kling v3 Pro 及 Grok Imagine Video,偏好率分别达 57%、59%、60% 和 69%;领先 Runway Gen-4.5 达 77%;面对 Luma Ray 3.2 更是获得了 93% 的压倒性支持。团队强调,目前模型仍在迭代优化中,未来表现将进一步提升。

FLUX 3 在人脸表情捕捉、声画物理关联及多语言能力上表现尤为突出,支持生成持续数分钟的连贯序列,并确保角色在不同场景中的一致性。

图像编辑与动作预测

在图像领域,FLUX 3 支持多种风格、宽高比及分辨率的合成与编辑。中期评估表明,其在处理复杂提示词、文字生成及多语言文字渲染精度上较早期版本有显著提升。

此外,FLUX 3 将世界理解延伸至动作预测。通过集成原生动作预测模块,模型利用预训练的视频骨干网络作为动力学基座,仅需少量任务数据微调即可胜任专门的动作控制任务。

机器人公司 mimic robotics 已成为首批合作伙伴,双方联合开发了 FLUX-mimic。该模型结合 FLUX 3 骨干网络与 mimic 在灵巧操控方面的专长,展示了从内容生成到物理控制的跨越。这证明 FLUX 3 不仅是内容创作工具,更是理解世界运作规律的通用模型。

发布节奏与未来规划

Black Forest Labs 计划在未来数月内逐步开放以下能力,各项功能均经过严格的安全测试与早期访问验证:

  • FLUX 3 Video:视频与音频的生成编辑,通过 API 及私有权重访问;
  • FLUX-mimic 与 FLUX 3 Action:动作预测功能,面向选定研究与商业合作伙伴开放;
  • FLUX 3 Image:图像合成与编辑,通过 API 及私有权重访问;
  • FLUX 3 Dev:面向内容创作与动作预测的开发版,将正式开源。

团队后续还将披露更多底层技术细节。Black Forest Labs 的终极目标是将感知、动作与语言预测统一于单一模型之中,应用场景将从交互式媒体编辑拓展至仿真、计算机操作及物理 AI 领域。目前,下一代模型的研发工作已在进行中。

参考资料:

https://bfl.ai/blog/flux-3

https://bfl.ai/models/flux-3

https://bfl.ai/blog/flux-3-mimic

END

【声明】内容源于网络
0
0
AIGC开放社区
1234
内容 1919
粉丝 0
AIGC开放社区 1234
总阅读44.3k
粉丝0
内容1.9k