适用版本:ComfyUI 0.30.0+ | 话题:MiniMax H3 · ComfyUI 视频生成 · AI 视频工作流

MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布的全模态视频生成模型,开放权重,能在同一上下文中同时接收文本、最多 9 张图片、3 段视频和 3 段音频作为输入,输出最高 2K 分辨率、最长 15 秒的带原生立体声音频视频,人声、音效和音乐在单次前向传播中一并生成,无需后期叠加;在 ComfyUI 中有两条接入路径——通过七牛云 MaaS 调 API(无需本地 GPU)或下载开放权重本地运行,覆盖文生视频、图生视频、参考生视频三种工作流模式。


MiniMax H3 能生成什么

在视频生成模型里,H3 的差异点在于真正的全模态输入——不是单纯的"文生视频"或"图生视频",而是能把图片、视频片段、音频素材混合给进去,让模型理解它们之间的关系后再生成。

几个关键参数:

  • 输出规格:最高 2K 分辨率,24fps,单次最长 15 秒

  • 原生音频:不是后期配音,是模型生成视频时直接合成立体声(对白 + 音效 + 背景音乐)

  • 文本编码器:Qwen3VL 32B(量化为 nvfp4_awq),具备强大的多语言和视觉理解能力

  • 三种生成模式:文生视频(T2V)、首尾帧生视频(FLF2V)、参考生视频(R2V)

模型以 int8 量化权重(pruned_int8_convrot 格式)开放,本地部署显存要求较高;如果不想买 GPU,走 API 调用是更省心的选择。


两条接入路径对比

维度

API 模式(推荐)

本地权重模式

硬件要求

无,计算在云端

高显存 GPU(Qwen3VL 32B 编码器体量大)

上手难度

低,导入工作流模板即可

需下载多个权重文件并手动配置节点

费用结构

按视频秒数计费

一次下载,本地电费

网络依赖

下载后离线可运行

适合场景

快速验证、小批量生成

大批量生产、需要完全控制


方式一:API 模式(零 GPU,七牛云 MaaS 接入)

第一步:获取 API Key

在七牛云 MaaS 平台(sufy.com)注册账户,进入 AI 推理服务,找到 MiniMax-H3 模型(模型 ID:minimax/minimax-h3),在账户中生成 API Key。

平台价格(人民币计费):

计费类型

单价

视频输出(2K)

¥0.80 / 秒

视频输入(2K 输出)

¥0.80 / 秒

视频输出(768P)

¥0.50 / 秒

视频输入(768P 输出)

¥0.50 / 秒

图片输入

¥0.20 / 张

以一条 10 秒 768P 视频为例,视频输出费用约 ¥5。

第二步:在 ComfyUI 中导入工作流模板

打开 ComfyUI(确保版本 ≥ 0.30.0),在模板库搜索以下关键词,导入对应 JSON:

生成模式

模板搜索词

文生视频

MiniMax H3 T2V

首尾帧生视频

MiniMax H3 FLF2V

参考生视频

MiniMax H3 R2V

也可直接从 Comfy-Org 的 GitHub 仓库下载对应 JSON 文件拖入导入。

第三步:填入 API Key,运行生成

在工作流的 API Key 节点填入从 sufy.com 获取的 Key,配置提示词和参数,点击运行即可。生成在云端完成,本地只收返回的视频文件。


方式二:本地权重模式

本地模式要求 ComfyUI 最低 0.30.0 版本,否则 MiniMax H3 的原生节点不可用。

需要下载的权重文件

从 Hugging Face Comfy-Org/MiniMax-H3 仓库下载,放入对应目录:

ComfyUI/
├── models/
│   ├── diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors   # T2V/I2V 用
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors  # R2V 用(与上面二选一)
│   ├── text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

注意:R2V 模式(参考生视频)使用 ref2va 扩散模型,与 T2V/I2V 使用的 fl2va 不同,需单独下载;文本编码器和 VAE 两种模式共用。

核心节点说明

ComfyUI 节点名

对应功能

MiniMaxH3TextToVideo

文生视频

MiniMaxH3ImageToVideo

图生视频(支持首帧 / 尾帧输入)

MiniMaxH3ReferenceToVideo

参考驱动生成

Resolution Selector

选择宽高比和分辨率

Patch Sage Attention KJ

可选,需 KJNodes 插件,加速推理


三种生成模式详解

文生视频(T2V)

最简单的模式,一段提示词出一段视频。提示词建议按"整体场景 → 分镜头描述 → 音频期望"的结构写,H3 会根据对音频的描述自动合成立体声。

宽高比预设:16:9(横屏)、9:16(竖屏)、1:1,时长 5–15 秒可调,分辨率最高 2K。

首尾帧生视频(FLF2V)

给定首帧图片(必填)和尾帧图片(可选),让模型补全中间的运动过程。

图片尺寸限制:宽高均在 256–5760 px 之间,宽高比在 2:5 到 5:2 之间;两帧需保持一致的宽高比,否则会强制裁切。

参考生视频(R2V)

最强大也最复杂的模式,可以混合多个视觉和音频参考源,让模型理解它们之间的关系后生成新视频。

输入上限:

  • 参考图片:最多 9 张

  • 参考视频:最多 3 段(每段 2–15 秒,总长 ≤15 秒,帧率需在 23.976–60 FPS 之间)

  • 参考音频:最多 3 段(总长 ≤15 秒,至少需要搭配一张图片或一段视频)

提示词中引用参考素材的格式:

 是主角,穿蓝色上衣,表情自然。

编号严格对应节点连接顺序,从 1 开始,不可跳号。


提示词写作要点

H3 的音频生成质量高度依赖提示词中对声音的描述,很多人忽略这一点导致输出音频平淡。建议每段视频的提示词包含三类声音描述:

  1. 对白或人声:说了什么、语气、情绪

  2. 环境音效:场景中应有的自然声音

  3. 背景音乐:风格、节奏、情绪基调

分辨率设置:短边建议 768px,推荐全质量设置在 16:9 比例下约 100 万像素(1344×768),分辨率数值须为 32 的倍数。

时长注意:H3 的时长参数会吸附到模型内部的帧块网格(24fps 下每块 17 帧),填入的秒数会自动取最近的有效值,不是所有整数秒都有效。


常见问题

Q:ComfyUI 用了 API 模式,生成结果保存在哪里?

API 模式下生成在 MiniMax 的云端服务器执行,结果以视频文件形式返回到本地 ComfyUI 的输出目录,与本地生成结果存放路径相同。

Q:本地模式至少需要多大显存?

官方文档未给出明确数值,但文本编码器 Qwen3VL 32B(量化为 nvfp4_awq)体量较大,加上扩散模型和两个 VAE,建议至少 24GB 显存,实际需求以社区测试为准。目前已有 RTX 4080(16GB)搭配 int8 量化权重运行的案例,但需要启用显存优化选项。

Q:通过七牛云 MaaS 调 API,模型 ID 怎么填?

在 API 请求中model 字段填 minimax/minimax-h3,接口端点参考 sufy.comapidocs.qnaigc.comigc.com)。

Q:R2V 模式的参考视频需要什么格式?

帧率在 23.976–60 FPS 之间,单段时长 2–15 秒,三段合计不超过 15 秒。格式建议 mp4,分辨率建议与目标输出分辨率接近。


小结

MiniMax H3 是目前少数真正实现"输入什么模态都能理解、输出带原生音频"的开放权重视频生成模型。ComfyUI 提供了两条接入路径:API 模式适合快速出片,不需要本地 GPU,通过七牛云 MaaS 按秒计费,门槛极低;本地权重模式适合需要完全控制的场景,但对硬件要求较高。三种生成模式中,R2V 的多参考融合能力是 H3 最有价值的差异化功能,值得重点探索。

本文数据基于 MiniMax 2026 年 7 月 31 日发布的模型权重和 ComfyUI 0.30.0 版本,如遇界面差异以官方最新文档为准。


延伸阅读

  • ComfyUI 官方 MiniMax H3 工作流文档:https://docs.comfy.org/zh/tutorials/video/minimax/minimax-h3

  • MiniMax H3 官方发布博客:https://www.minimaxi.com/blog/minimax-h3

  • MaaS 模型广场(含 MiniMax-H3 接入信息)

  • ComfyUI 节点权重下载仓库:https://huggingface.co/Comfy-Org/MiniMax-H3