- 博客
- MiniMax H3 ComfyUI:T2V、I2V 与 R2V 工作流完整配置指南
AI 概览
可以在 ComfyUI 中本地运行 MiniMax H3 吗?
可以。MiniMax H3 具有开源权重,并原生支持 ComfyUI 0.30.0 或更高版本。加载一个 H3 模板,下载所需的扩散模型、文本编码器以及两个 VAE 模型,即可在您自己的硬件上运行。
MiniMax H3 在 ComfyUI 中支持哪些工作流?
ComfyUI 内置了针对文本生成视频(T2V)、带可选首帧/尾帧的图像生成视频(I2V)以及参考图生成视频(R2V)的 H3 模板。这三种工作流均可同步生成原生立体声对话、音效与配乐,并与视频一同输出。
在 ComfyUI 中运行 MiniMax H3 需要多少 VRAM?
不存在单一硬性最低要求。对于剪枝后的 int8 工作流,24GB 显存 GPU 是较实用的目标;社区中已验证可在 12GB GPU + 32GB 系统内存、启用卸载(offloading)及高速存储条件下完成 480p 分辨率的简化测试。
Ready to try it yourself?
Free credits on signup. Plans from $20/month.
是否存在比在 ComfyUI 中本地运行 MiniMax H3 更简单的替代方案?
有。Seedance 提供基于浏览器的音视频生成服务,无需本地下载模型、配置节点或规划 GPU 显存,当您更关注获得成品视频而非自定义本地节点图时,该方案更为简便。
什么是 MiniMax H3?为何要在 ComfyUI 中运行它?
MiniMax H3 是一款开源权重、全模态(omni-modal)生成模型,可在统一上下文中理解文本、图像、视频与音频。它最高可生成 2K 分辨率、24fps、约 15 秒长度的视频,并同步生成语音、音效与配乐,全部以原生立体声格式输出。
ComfyUI 将这些能力转化为可视化的节点图。您可以自由选择模型精度、随机种子(seed)、分辨率、时长、调度器(scheduler)、参考输入、首帧或尾帧,以及输出路径——随后将整个节点图保存为可复用的生产级工作流。官方模板已覆盖 T2V、I2V 与 R2V 场景,而核心 H3 节点亦可灵活重组,构建更专业定制化的工作流。
当参数精细控制、节点复用性、输入私密性或批量自动化比部署耗时更重要时,请选择本地运行 H3。它适合已熟悉 ComfyUI 的创作者,也适用于希望规避按次调用 API 配额限制的团队。其权衡在于:需占用大量存储空间、需细致规划 GPU 显存、模型下载耗时较长,且排错难度高于纯浏览器工作流。
系统要求与模型下载
请先将 ComfyUI 升级至 0.30.0 或更高版本,然后打开 Workflow → Browse Workflow Templates → Video,并选择任一 MiniMax H3 模板。ComfyUI 可自动提示缺失文件,但手动放置文件更便于问题诊断。
| 必需文件 | 放入路径 | 用途 |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors |
ComfyUI/models/diffusion_models/ |
用于 T2V、I2V 及首/尾帧生成 |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors |
ComfyUI/models/text_encoders/ |
多模态提示词与参考内容理解 |
minimax_h3_video_vae_fp16.safetensors |
ComfyUI/models/vae/ |
视频潜在空间(latent)编码与解码 |
minimax_h3_audio_vae_fp32.safetensors |
ComfyUI/models/vae/ |
原生音频编码与解码 |
R2V 工作流需使用 diffusion_models/ 目录下的 minimax_h3_ref2va_pruned_int8_convrot.safetensors,而非 FL2VA 扩散模型文件。请保留完整文件名;添加后请刷新模型列表或重启 ComfyUI。
请将 24GB VRAM 视为剪枝 int8 路径下较舒适的规划目标,而非官方公布的最低要求。显存较低的显卡需采用更小帧尺寸、更短视频时长、更激进的卸载策略,并确保系统内存充足、NVMe 存储空间足够以支持模型交换。若节点图无法加载,或大部分时间耗费于显存交换(swapping),请优先降低分辨率,或考虑将工作流转至云端硬件执行。
MiniMax H3 文本生成视频(T2V)工作流配置
- 打开模板库,加载 MiniMax H3 T2V 模板。
- 确认已正确选择扩散模型、Qwen3-VL 文本编码器、视频 VAE 与音频 VAE。
- 在 Resolution Selector(分辨率选择器) 中选择宽高比与百万像素数(megapixels);保持
multiple参数为32。 - 输入一条结构化提示词(prompt),设置视频时长与随机种子(seed),然后提交该节点图(queue the graph)。
- 在提升分辨率前,先预览画面、对话、音效、配乐及最终帧效果。
H3 的原生工作画布采用 768px 短边,并将单边长度上限设为约 1344px。在 16:9 比例下,约 1.0 百万像素 对应分辨率约为 1344×768。建议先以更低分辨率进行提示词测试,仅对已验证有效的配置再逐步提升分辨率。视频时长会按 H3 的帧块(frame-block)网格(24fps)自动对齐,因此 ComfyUI 可能对您输入的时长值做轻微调整。
请先撰写场景描述,再依次加入定时动作、镜头运动与音频说明,全部写入同一段提示词中。一份简洁清晰的 T2V 提示词,远比堆砌大量互不相关的电影术语更可靠。如需更快捷的托管起点,Seedance 文本生成视频工作流 可跳过本地节点图配置与模型下载步骤。
src=https://r2.seedance.tv/blog/minimax-h3-comfyui/official-t2v-output-v1.mp4
poster=https://r2.seedance.tv/blog/minimax-h3-comfyui/official-t2v-poster-v1.png
label=MiniMax H3 T2V · 官方 ComfyUI 模板输出
MiniMax H3 T2V 的官方 ComfyUI 模板输出。此为真实工作流样例,由 Seedance R2 托管以保障稳定播放。
MiniMax H3 图像生成视频(I2V)工作流配置
I2V 模板使用节点 MiniMaxH3ImageToVideo。将一张图像连接至 first_frame 输入端口,可选地将另一张图像连接至 last_frame 端口,并在提示词中描述二者之间的运动过程。这两个输入在节点层面均为可选,因此同一套 FL2VA 权重可同时支持纯文本驱动、仅首帧、仅尾帧,或首尾帧并用等多种工作流。
I2V 最适用于产品展示、角色连贯性呈现、受控转场及风格化动画。请将输出尺寸匹配 H3 的 768px 短边画布,保持长宽均能被 32 整除,并避免输入过小或严重压缩的源图像。请先明确描述需保持不变的内容,再说明镜头运动。

随 ComfyUI 的 MiniMax H3 I2V 模板一同分发的真实输入图像。
src=https://r2.seedance.tv/blog/minimax-h3-comfyui/official-i2v-output-v1.mp4
poster=https://r2.seedance.tv/blog/minimax-h3-comfyui/official-i2v-poster-v1.png
label=MiniMax H3 I2V · 官方 ComfyUI 模板输出
该源图像生成的官方 I2V 结果。请对比产品外形、材质、滚轮位置、摄像机运动路径及声音——而不仅限于首帧视觉冲击力。
如需实现相同的“输入→动态”理念,但又不想维护本地权重,请尝试 Seedance 图像转视频(Image to Video)。
MiniMax H3 参考视频(R2V)工作流配置
R2V 使用 MiniMaxH3ReferenceToVideo 节点及独立的 ref2va 扩散权重。它支持混合输入:图像、视频与音频,因此目标镜头可分别从不同来源借用角色身份、视觉风格、主体运动、摄像机运动或人声。
请按明确顺序连接参考素材,并在提示词中严格使用如下命名:<Picture 1>、<Video 1> 和 <Audio 1>。为每个参考指定唯一任务。例如:从 <Picture 1> 保留角色形象,从 <Video 1> 复用推轨运镜,从 <Audio 1> 匹配人声音色。当前 ComfyUI 工作流最多支持九张图像、三段视频及三段独立音频片段。
使用 ref_image_size=match 可加速测试;若身份保真度优先于速度,则使用 max,以在不超过 2048px 前提下保留参考图像的较短边。过多重叠参考会削弱指令遵循能力,因此请先验证双参考图效果,再逐步增加。
src=https://r2.seedance.tv/blog/minimax-h3-comfyui/official-r2v-output-v1.mp4
poster=https://r2.seedance.tv/blog/minimax-h3-comfyui/official-r2v-poster-v1.png
label=MiniMax H3 R2V · 官方 ComfyUI 模板输出
使用分发版角色与风格参考生成的官方 R2V 模板输出。
如需托管式参考工作流,请打开 Seedance 参考视频(Reference to Video)。MiniMax H3 参考视频指南 提供更深入的提示词撰写与参考分配实操说明。
提升 MiniMax H3 输出质量的提示词撰写技巧
H3 提示词需明确使用三个字段:integrated_multimodal_description(整合式多模态描述)、overall_soundscape(整体声景)和 non_diegetic_music(非叙事性音乐)。在场景描述中,请写明分段时间码镜头、可见动作、摄像机调度及精确对白;为反复出现的说话人分配稳定 ID(如 (S1)),且仅将实际说出的词语置于 <d>[English] ...</d> 标签内。
T2VA — 较弱: 一个具有酷炫音效的电影级城市场景。
T2VA — 更优: 0–3 秒:宽幅雨中斑马线镜头,缓慢向前推轨;3–7 秒:快递员转向镜头。立体声脚步声与车流声;低频打击乐于第 4 秒起奏。
I2VA/FL2VA — 较弱: 对此图像进行戏剧化动画处理。
I2VA/FL2VA — 更优: 保持产品几何结构、滚轮、按键、透明外壳及蓝橙配色照明。执行一次缓慢的 30 度环绕运镜;不添加新文字或部件。最终帧须与所提供末帧对齐。
R2V — 较弱: 综合运用全部参考素材,制作一段动作视频。
R2V — 更优: 从 <Picture 1> 保留角色身份与服装;仅从 <Video 1> 复制摄像机运动;从 <Audio 1> 匹配人声音色。不得迁移视频中的主体或背景。
T2VA 需完整构建世界设定;I2VA 应先保护源图像,再叠加运动;FL2VA 与 L2VA 必须描述向所提供边界帧的过渡过程;R2V 则必须阐明每个参考与目标之间的关系。MiniMax H3 提示词指南 进一步展开各模式专属的提示范式。
MiniMax H3:ComfyUI 本地部署 vs. 浏览器端 AI 视频工具对比
| 维度 | ComfyUI 本地运行 H3 | Seedance | Comfy Cloud |
|---|---|---|---|
| 配置方式 | 安装/更新 ComfyUI,并放置大型权重文件 | 直接在浏览器中打开 | 加载托管式 ComfyUI 模板 |
| 本地显存(VRAM) | 必需;具体需求取决于精度与输出设置 | 无需 | 本地无需 |
| 工作流控制 | 全节点级控制与自动化能力 | 简化生成界面 | 无本地硬件的 ComfyUI 图形界面 |
| 原生音频支持 | H3 原生立体声音频,与视频同步生成 | 音视频联合工作流 | 云端计算下的相同 H3 工作流 |
| 最适用场景 | 深度定制、本地输入、可复用图形 | 无需配置的快速构思与生产 | 拥有 ComfyUI 使用经验但缺乏本地 GPU 的用户 |
当工作流图本身即为您的生产系统组成部分时,请选择本地 ComfyUI;当您希望使用其节点功能却不愿承担硬件负担时,请选择云托管 ComfyUI;当您希望从提示词或参考素材直接产出可用成片,且希望减少基础设施决策时,请选择 Seedance。立即在浏览器中试用 Seedance →
总结
MiniMax H3 是 ComfyUI 中最具能力的开源权重模型之一,可同步生成视频与原生音频。启动流程仅需三步:升级至 ComfyUI 0.30.0+,将扩散模型、文本编码器及两个 VAE 放入对应文件夹,随后加载匹配的 T2V、I2V 或 R2V 模板。初期测试宜从小规模开始,为每个参考明确分配任务,并在提示词验证有效后再提升分辨率;若本地下载、显存占用与节点维护成本已超出深度控制带来的收益,则基于浏览器的 Seedance 工作流将是更快抵达生产的路径。
Ready to try it yourself?
Put the steps from this guide into practice with Seedance and turn prompts or images into polished videos in minutes.
Free credits on signup. Plans from $20/month.
Related Articles
More posts in the same locale you may want to read next.

Seedream 5.0 产品海报提示词指南:模板、布光与背景替换
借助六部分 Seedream 5.0 提示词公式、五种产品模板、三种布光方案、文字排版规则及背景替换工作流,打造更具表现力的产品海报。
Read article
Seedream 5.0 信息图提示词指南:模板、文字技巧与 5 个即用型示例
借助七步 Seedream 5.0 提示词公式、五个可复用模板、实用文字技巧及五个即用型示例,打造更清晰的 AI 信息图。
Read article
Seedream 5.0 与 Nano Banana 2 对比:速度、质量,以及 2026 年该如何选择
对比 Seedream 5.0 与 Nano Banana 2 在速度、图像质量、角色一致性、定价、电商应用、多语言设计及生产工作流等方面的表现。
Read article