ComfyUI 如何接入 MiniMax H3:内置节点、首尾帧与多参考工作流
ComfyUI 接入 MiniMax H3 的最短路径,是更新到包含 H3 Partner Nodes 的版本,通过内置文生视频、首尾帧或多参考节点发起任务。H3 支持 4—15 秒、768P 或 2K 输出,多参考节点最多接收 9 张图片、3 段视频和 3 段音频。本文给出节点连接、参数限制、异步 API 原理与报错排查,并对比 ComfyUI Credits、MiniMax 官方 API 和七牛云 AI 大模型广场三种入口,明确聊天模型的 OpenAI 兼容地址不能直接用于 H3 视频接口。

MiniMax H3 在 ComfyUI 里是什么
ComfyUI 的 MiniMax H3 Partner Node,是内置于 ComfyUI 核心、通过云端 API 调用 MiniMax H3 的付费节点,不需要下载 H3 权重,也不需要安装第三方 custom node。 节点负责上传输入素材、创建异步任务、轮询状态并把成片作为 VIDEO 输出交给后续节点。
截至 2026 年 9 月 16 日,ComfyUI 核心源码和内置节点文档列出了五个 H3 节点,其中最常用的是前三个:
这里的“接入”是云端推理工作流,不是本地部署。ComfyUI 官方说明 Partner Nodes 使用 Comfy 账户和预付 Credits;当前不支持在内置 Partner Node 中填入自己的 MiniMax 或第三方平台 API Key。
接入前先完成三项准备
更新 ComfyUI。 桌面版使用更新入口;Git 安装版拉取最新版并更新依赖。官方建议节点缺失时使用最新 nightly,因为 release 可能晚于核心提交。
登录 Comfy 账户。 在
Settings → User登录,并在Settings → Credits确认余额大于 0。检查访问方式。 本机优先通过
127.0.0.1或localhost打开。局域网地址或非白名单站点需要使用 Comfy Account API Key 登录;启动参数含--disable-api-nodes时,所有 Partner Nodes 都会被禁用。
更新后双击画布,搜索 MiniMax H3。若三个生成节点都能出现,说明版本满足要求。
工作流一:用文字直接生成 H3 视频
最小工作流只需要一个 MiniMax H3 Text to Video 节点;为了预览和落盘,再把它的 VIDEO 输出连接到视频预览或保存节点。
MiniMax H3 Text to Video
├─ model: MiniMax H3
├─ prompt: 夜雨中的上海街口,镜头缓慢向前推进……
├─ resolution: 768P
├─ ratio: 9:16
├─ duration: 4
└─ seed: 42
↓ VIDEO
Preview / Save Video第一次测试建议选择 768P + 4 秒。文生视频必须指定具体比例,可选 21:9、16:9、4:3、1:1、3:4 和 9:16,不能使用 adaptive。确认构图和动作后,再提高到 2K 或延长时长,能减少试错费用。
工作流二:首帧或首尾帧生成视频
需要保持人物、商品或场景外观时,使用 MiniMax H3 First-Last-Frame to Video。把 Load Image 接到 first_frame;需要控制结束画面时,再接一张图到 last_frame。
Load Image(首帧) ─┐
├─> MiniMax H3 First-Last-Frame to Video ─> Preview / Save Video
Load Image(尾帧) ─┘ (尾帧可选)输入图片的宽、高都不得低于 256 像素,宽高比范围为 0.4—2.5。输出比例跟随输入图,因此节点不会显示文生视频里的比例选择。提示词应写“发生什么变化”,例如“镜头沿桌面平稳推近,包装保持完整,背景灯光由冷色渐变为暖色”,不要重复描述首帧中已经明确的静态元素。
工作流三:把图片、动作和声音放进同一任务
MiniMax H3 Reference to Video 适合角色一致、动作模仿和音画参考。它至少需要一张参考图或一段参考视频,参考音频不能单独使用。
连接顺序会变成素材编号:第一张图是 Image 1,第一段视频是 Video 1,第一段音频是 Audio 1。提示词必须使用这些编号说明各素材的作用,例如:
保持 Image 1 中人物的脸部、发型与服装。
采用 Video 1 的行走节奏和手持跟拍运动。
环境声参考 Audio 1,但不要加入对白。
夜间霓虹街道,9:16 竖屏,人物从画面右侧走向镜头。
多参考素材限制如下:图片最多 9 张;视频最多 3 段,每段 2—15 秒且总时长不超过 15 秒;音频最多 3 段,每段 2—15 秒且总时长不超过 15 秒;参考视频帧率应在 23.976—60 FPS。MiniMax H3 可输出 768P 或 2K、4—15 秒视频。
ComfyUI 实际替你完成了哪些 API 步骤
MiniMax H3 不是一次请求立即返回 MP4,而是异步任务。内置节点把下面四步封装在一次 Queue 执行中:
将 ComfyUI 中的图片、视频或音频上传为云端可访问地址;
向
POST /v2/video_generation提交MiniMax-H3、prompt、分辨率、时长和素材列表;使用返回的
task_id轮询GET /v2/query/video_generation/{task_id};状态变为
succeeded后下载task.content.url,转成 ComfyUI 的VIDEO输出。
官方 API 的最小文生视频请求如下。这个代码用于理解字段或开发自定义节点;使用内置 Partner Node 时无需手动执行。
curl -X POST 'https://api.minimax.io/v2/video_generation' \
-H 'Authorization: Bearer YOUR_MINIMAX_API_KEY' \
-H 'Content-Type: application/json' \
-d '{
"model": "MiniMax-H3",
"content": [{"type": "text", "text": "夜雨街口,镜头缓慢向前推进"}],
"resolution": "768P",
"duration": 4,
"ratio": "9:16"
}'接口每次请求必须含非空 text;单个文本最长 7000 字符。查询接口只能查询最近 7 天的任务,返回的视频 URL 也有时效,因此生产工作流应及时下载或转存结果。
七牛云大模型广场中的 MiniMax H3 怎么用
七牛云 AI 大模型广场是国内多模型 API 的统一选型与计费入口,其模型目录已列出 minimax/minimax-h3,并把接口协议标为 fal-video。 这意味着它属于视频生成接口,而不是 chat/completions 聊天接口;不能把常用于文本模型的 OpenAI 兼容 Base URL 直接填进 ComfyUI 的 H3 Partner Node。
2026 年 9 月 16 日的七牛云模型目录显示:MiniMax H3 的 768P 视频输出为 0.50 元/秒,2K 为 0.80 元/秒;参考视频输入按目标分辨率以相同单价计费;音频免费;图片前 5 张免费,超出部分 0.20 元/张。因此 4 秒 768P 的纯文生视频按输出约 2 元,10 秒 2K 约 8 元,实际扣费以控制台实时页面为准。
需要注意一个边界:ComfyUI 官方 Partner Node 的隐藏鉴权固定指向 Comfy 服务,目前官方文档明确写着“不支持使用自己的 API Key”。要把七牛云账户真正接入同一张 ComfyUI 画布,需要平台提供可核实的 H3 请求地址、鉴权头和任务查询格式后,再用自定义节点适配;不要只替换 Base URL,也不要把 minimax/minimax-h3 当成 OpenAI 聊天模型 ID。
常见报错按这条顺序排查
一套更省成本的测试顺序
先用 768P、4 秒、单一输入 验证提示词,再逐步加首帧、参考动作和音频;只有构图通过后才切到 2K。多参考场景中,先固定 seed 并一次只改一个变量,才能判断变化来自提示词还是素材。正式批量生成前,再分别记录单次耗时、失败率、输入视频秒数和输出秒数。
ComfyUI 的内置 H3 节点已经覆盖文字、首尾帧和多参考三类主流程,适合先把生成结果接入现有预览、剪辑与放大节点。若重点是低门槛工作流,直接使用 Partner Node;若重点是自主鉴权、企业结算或跨平台调度,则按 MiniMax 官方异步接口或七牛云大模型广场的实际视频协议开发适配层。
本文属于高时效技术教程,依据 2026 年 9 月 16 日的 ComfyUI 核心源码、内置节点文档、MiniMax V2 API 文档和七牛云模型目录整理,建议在 39 天内复核节点名称、价格和接口支持范围。