- 博客
- FLUX 3 Video 评测:多模态能力、20 秒视频片段与坦诚的局限性
AI 概览
什么是 FLUX 3 Video?由谁开发?
FLUX 3 Video 是 Black Forest Labs 推出的统一多模态模型,支持视频、音频、图像及动作生成。该模型于 2026 年 7 月发布,其视频功能支持文本到视频(text-to-video)与图像到视频(image-to-video)生成,最长可达 20 秒,并原生集成音频。
FLUX 3 Video 的画质相比其他模型如何?
FLUX 3 在动态字体排印、广泛视觉风格、对话表现及自然感较强的简单场景方面尤为出色。若需托管式 2K 输出、处理复杂物理效果或长时程物体一致性任务,MiniMax H3 仍是更稳妥的选择。
FLUX 3 Video 的费用是多少?
合作伙伴 API 定价约为每秒 0.17 美元,即 10 秒约 1.70 美元。Black Forest Labs 未公布简明的公开按秒计费标准,因此批量调用前请务必确认当前服务商的实际报价。
Ready to try it yourself?
Free credits on signup. Plans from $20/month.
我能否在本地 ComfyUI 中运行 FLUX 3 Video?
目前尚不支持通过官方面向消费者发布的权重文件进行本地运行。ComfyUI 或 Comfy Cloud 中可能出现托管式 API 工作流,但本地自托管依赖于计划中的 FLUX 3 Dev 开源权重版本——该版本尚未公布确切发布时间。
FLUX 3 Video 究竟是什么——一个模型,通用于全部任务
FLUX 3 并非仅专注于视频生成的独立检查点(checkpoint),再额外拼接语音与音效工具。它是一个多模态基础模型,在单一架构中联合训练图像、视频、音频与动作。其 Self-Flow 方法对齐了各类模态:生成的视觉冲击可影响声音设计,一句台词可驱动口型变化,一张参考图像亦可引导后续视频帧。
这一设计正是本产品的核心优势。创作者可在文本、起始图像、关键帧、现有影像素材、对白与环境音之间自由切换,而无需将每一类资产视为彼此割裂的独立任务。但同样重要的是其权衡取舍:广谱型基础模型,并不会在每一项运动表现、分辨率或一致性测试中自动超越专用视频模型。
上方官方生成帧更有力地展现了 FLUX 3 的视觉表现力:一名身着亮红色大衣的人物立于荧光绿调的自助洗衣店内。居中构图的主体、重复出现的圆形洗衣机,以及强烈互补的红绿配色,共同构成极具张力的图形钩子,同时确保画面清晰可读。
FLUX 3 Video 的实际能力——功能与规格
当前生成版本提供的控制选项远超基础文本到视频:
- 最长 20 秒:单次生成即可完整呈现一段对白节奏或短广告场景,而非在 5 或 10 秒后强制中断。
- 原生音频:对白、音效与环境音均随画面同步生成,无需后期单独添加配音轨道。
- 文本、图像与关键帧输入:可从提示词出发,对起始图像进行动画化,定义结束图像,或连接多个关键帧。
- 视频续写(Video continuation):提供最多 4 秒的现有视频与音频,模型将无缝延续动作、运镜、对白及声音。
- 多镜头切换:单次生成内即可切换场景或摄像机角度,同时保持整个序列的连贯性。
- 字体排印(Typography):标题、标牌、屏幕图形及动态文字均可作为场景有机组成部分直接渲染。
- 风格广度:可自由切换于纪实手持摄影、动画、广告、怀旧风或精修电影等不同风格。
- 分辨率:生成默认为高清(HD),全高清(Full HD)输出可通过超分实现;请注意,1080p 不等同于原生 2K 渲染。

官方 FLUX 3 输出示例:三张输入关键帧被连接成一段 10 秒视频序列。时间轴形式使该控制方法比孤立的最终帧更易理解。
src=https://r2.seedance.tv/blog/flux-3-video-review/official-typography-demo-v1.mp4
poster=https://r2.seedance.tv/blog/flux-3-video-review/official-typography-poster-v1.jpg
label=官方 FLUX 3 输出 · 带原生音频的动态字体排印
该字体排印示例为真实生成片段,而非人工设计的模拟稿。若需在选定生产模型前验证类似概念,可先使用 Seedance 文本到视频工作流,并采用相同的简报内容、时长与宽高比。
真实世界画质表现——FLUX 3 的领先之处与不足之处
FLUX 3 最显著的优势在于运动中的图形内容表现。终端文字、片头字幕、标牌与设计类字体,其呈现远比许多视频模型产生的模糊乱码更具意图性与准确性。它亦能自如游走于纪实、复古、动画与商业广告等多种风格之间。对白场景则得益于音视频联合建模:语音、表情与空间声场得以协同规划。
src=https://r2.seedance.tv/blog/flux-3-video-review/official-dialogue-demo-v1.mp4
poster=https://r2.seedance.tv/blog/flux-3-video-review/official-dialogue-poster-v1.jpg
label=官方 FLUX 3 输出 · 带原生音频的 20 秒对白场景
```这个完整的 20 秒样片展示了真实的时长优势。请在取消静音后聆听,同时全程观察视线方向、面部变化、麦克风几何位置以及镜头稳定性——只有当最后几秒仍可用时,更长的输出才真正有意义。
局限性在更严苛的制作测试中显露无遗。原生生成路径为 HD 分辨率,并通过 Full HD 上采样提升;而 H3 的托管工作流则可达到 2K 重建路径。快速交互、碰撞、手与道具的接触以及持续存在的物体仍可能出现漂移。时长上限为 20 秒,但若提示词缺乏时间控制,动作可能提前结束或不自然地拉伸。社区批评“H3 看起来更锐利”是合理的——前提是对比基于高密度运动与交付分辨率,而非仅聚焦于字体排印效果。
提示词结构仍显著影响结果。请采用时间顺序结构:主体 → 动作 → 镜头 → 对白 → 声音,而非堆叠形容词。[MiniMax H3 提示词指南](/zh/blog/minimax-h3-prompting-guide) 提供了一套可迁移的逐镜语法,适用于公平测试。
## 定价 —— $0.17/秒的实际含义
常被引用的“每秒 $0.17”这一数字源自合作伙伴 API 列表,而非简单的公开 BFL 价目表。请将其视为规划估算值,并在实际投入前核查实时端点价格。
| 制作量 | 预估生成成本 |
| --- | ---: |
| 一条 10 秒片段 | 约 $1.70 |
| 十条 10 秒片段 | 约 $17 |
| 一百条 10 秒片段 | 约 $170 |
| 一条 20 秒片段 | 约 $3.40 |
以上总额未计入失败拍摄、重试、上采样、存储、剪辑及平台加成费用。若某项活动需为每个获批片段准备四个候选版本,则预算应基于候选数量,而非最终交付物数量。MiniMax H3 的已发布合作伙伴定价约为每秒 $0.08,这意味着 FLUX 3 在 API 阶段的成本约为其两倍。Comfy Cloud 采用按算力或积分计费模式,属于另一条成本路径,而非免费本地推理。
实际结论:当前 API 定价对于原型开发、以字体排印为核心的广告以及高价值创意测试而言较为合理;但在审批通过率提升或开源权重推动可拥有基础设施降低可变成本之前,尚难支撑无人值守的大批量生产。
## ComfyUI 与本地部署 —— 当前状态
目前尚无面向消费者本地推理的官方 FLUX 3 Dev 检查点(checkpoint)。Black Forest Labs 已宣布将推出开源权重多模态变体,但尚未承诺公开发布日期或硬件适配目标。这意味着下载名称相似的社区文件,并不能构建出官方认可的本地 FLUX 3 视频工作流。
当前可行路径为托管式:当对应合作伙伴节点或云目录在 ComfyUI 中可用时,使用 API 工作流,提供服务商密钥,由远程基础设施返回视频片段。你仍可获得可复用的节点图,用于提示词管理、参考素材、后期处理与导出,但模型本身并不在本地工作站运行。
若今日即需本地控制权,[LTX 2.5 是更切实可行的开源权重方案](/zh/blog/ltx-2-5-review)。H3 同样提供可下载权重,不过其音视频联合流水线对显存(VRAM)、系统内存及高速存储有较高要求。
## FLUX 3 视频 vs MiniMax H3 —— 哪一个更适合你的工作流?
选择关键不在于绝对优胜者,而在于你任务中的瓶颈所在。在比对输出前,请先借助 [最佳 MiniMax H3 设置指南](/zh/blog/best-minimax-h3-settings) 建立稳定的 H3 控制基准;否则,薄弱的基线会让任何竞品都显得比实际更强。
| 维度 | FLUX 3 视频 | MiniMax H3 |
| --- | --- | --- |
| 最长片段 | 最长 20 秒 | 在所比对的托管路径中通常为 10 秒 |
| 最高交付路径 | HD 原生生成 + Full HD 上采样 | 托管式 2K 重建 |
| 原生音频支持 | 是 | 是,32kHz 立体声 |
| 字体排印 / 文字动画 | 核心优势 | 基础功能 |
| 复杂物理运动 | 表现参差 | 更强 |
| 本地开源权重 | FLUX 3 Dev 已规划中 | 当前已提供 |
| 合作伙伴 API 近似单价 | 约 $0.17/秒 | 约 $0.08/秒 |
| 最佳适用场景 | 品牌广告、文字动效、多模态与长时长测试 | 精确物理运动、质量优先交付、成本敏感型项目 |
若概念依赖可读性强的动态图形、20 秒完整场景、多样化视觉风格,或单次生成即含对白,请选择 FLUX 3;若物理细节精度、托管式 2K 成片、本地权重支持或生成成本更为关键,则 H3 更合适。如需更全面的质量与工作流对比,参见 [Seedance 2.5 vs MiniMax H3](/zh/blog/seedance-2-5-vs-minimax-h3)。
## 结论
FLUX 3 Video 是一款真正的多模态基础模型,而不仅仅又是一个专用视频模型。其字体排印能力、风格广度、原生音频支持、关键帧控制、续写能力以及 20 秒视频片段等特性,带来了切实优势;而其高清至 1080p 的输出路径、合作伙伴定价策略、复杂物理模拟能力,以及尚未发布的本地权重文件,则仍是现实约束。待 FLUX 3 Dev 发布后,这一平衡或被打破。若需当下即用的高托管质量与更简化的制作流程,[立即在 Seedance 上创作您的下一个视频 →](/zh)。
Ready to try it yourself?
Put the steps from this guide into practice with Seedance and turn prompts or images into polished videos in minutes.
Free credits on signup. Plans from $20/month.
Related Articles
More posts in the same locale you may want to read next.

Seedream 5.0 产品海报提示词指南:模板、布光与背景替换
借助六部分 Seedream 5.0 提示词公式、五种产品模板、三种布光方案、文字排版规则及背景替换工作流,打造更具表现力的产品海报。
Read article
Seedream 5.0 信息图提示词指南:模板、文字技巧与 5 个即用型示例
借助七步 Seedream 5.0 提示词公式、五个可复用模板、实用文字技巧及五个即用型示例,打造更清晰的 AI 信息图。
Read article
Seedream 5.0 与 Nano Banana 2 对比:速度、质量,以及 2026 年该如何选择
对比 Seedream 5.0 与 Nano Banana 2 在速度、图像质量、角色一致性、定价、电商应用、多语言设计及生产工作流等方面的表现。
Read article