MiniMax-H3 与 H3 Max 视频生成加速:从 1.95× 无损到 6.24× 的实测指南
截至 2026 年 8 月 31 日,MiniMax-H3 是支持文本、图片、视频和音频输入并输出视频的开源全模态模型;H3 Max 是 fal 基于 H3 后训练的高速版本。LMSYS 在 8×H200 上测得 H3 无损推理 1.85–1.95 倍、组合优化最高 6.24 倍;fal 报告 H3 Max 约 3 秒生成 5 秒视频。本文解释测试口径、质量代价、接入步骤,并区分模型与计费边界。
先看结论:速度提升来自三层优化
MiniMax-H3 视频推理加速,是在固定画质基线之上减少每一步的计算成本,而不是简单减少视频帧数。 在 LMSYS 的公开测试中,SGLang 的密集无损路径为 1.85–1.95 倍;加入步复用和稀疏注意力后,最高记录为 6.24 倍。
三个数字先分清
LMSYS 的数据测于 2026 年 8 月 18 日,fal 的 H3 Max 公告发布于 2026 年 8 月 27 日。两组数字都有效,但不能拼成一个“统一 35 倍”的结论。
H3 与 H3 Max 不是同一个发布物
MiniMax-H3 是基础模型,H3 Max 是 fal 对 MiniMax H3 做后训练并重新设计推理系统后的服务版本。 这是阅读速度、价格和 API 文档时最重要的边界。
七牛云 AI 大模型广场当前将 minimax/minimax-h3 标为上新模型:它可融合文本、最多 9 张图片、3 段视频和 3 段音频,输出视频按分辨率计费,2K 为 0.80 元/秒、768P 为 0.50 元/秒;图片前 5 张免费,超出部分为 0.20 元/张。
该页面的模型元数据将输出模态标为 video,但没有把它标成 OpenAI Chat Completions 模型,因此不能把聊天接口示例直接当成视频生成请求。
fal 的 H3 Max 页面描述了另一条产品路径:它对开放权重 MiniMax H3 进行后训练,并在 NVIDIA GB200 NVL72 上训练和服务。
fal 对 12 个视频模型做了人类偏好评测,H3 Max 在整体质量、提示词理解和审美三个维度均排名第一;这些结论属于 fal 的评测口径。
LMSYS 实测:先建立无损基线
在同一提示词、分辨率、帧率和去噪步数下,无损运行时的 1.85–1.95 倍是最稳妥的第一阶段收益。 LMSYS 使用 8×NVIDIA H200(每张 141 GB),输入输出为 1344×768、24 FPS、50 个去噪步,SGLang 版本为 v0.5.18。
T2VA 是文本到视频,FL2VA 是首帧到视频。LMSYS 只统计生成侧推理时间,不含服务启动、预热、HTTP 轮询和 MP4 下载;线上 SLA 必须重新测端到端延迟。
同一 SubBlock 0.80 + Cache-DiT stride 配置在 FL2VA 10 秒测试中为 34.80 秒、6.24 倍加速,平均 SSIM 为 0.9144;这就是全文提到的最高值。
三层优化原理:哪些计算被省掉了
1. Fused kernels:每一步少搬数据
融合内核把 AdaLN、门控残差、SwiGLU、QK RMSNorm 和 3D RoPE 合并,减少中间张量、显存读写和内核启动次数。LMSYS 的孤立微基准中,QK RMSNorm 与 3D RoPE 的融合点达到 12.16 倍,但这是单算子数据,不能直接相加成端到端加速。
2. Cache-DiT:复用相邻去噪步骤
Cache-DiT 在共享 DiT 模块栈上比较残差变化;变化低于阈值时,复用中间结果并跳过部分去噪计算。质量优先可只开 conservative 配置,LMSYS 测得最高约 2.99 倍,平均 SSIM 仍在 0.90–0.92 区间。
3. SubBlock:减少注意力读取范围
SubBlock 将序列切成 64 token 的块,再按 16 token 子块估计注意力质量。sparsity=0.75 大致保留四分之一的 key block,0.80 更快但 SSIM 更低;前 10 个去噪步使用稠密注意力,短序列仍走稠密回退路径。
如何接入:先用统一 API 生成分镜,再调用视频模型
视频模型的调用协议必须以当前模型详情页为准,不能假设所有模型都支持 OpenAI Chat Completions。 一个可运行的做法是先用兼容接口生成分镜和提示词,再把结果交给 H3/H3 Max 对应的视频任务 API。
1. 用七牛云兼容接口生成分镜文本
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["QINIU_API_KEY"],
base_url="https://api.qnaigc.com/v1",
)
storyboard = client.chat.completions.create(
model="minimax/minimax-m2",
messages=[
{
"role": "user",
"content": "把‘雨夜霓虹街道’拆成 4 个连续镜头,每个镜头给出主体、镜头运动和环境音。",
}
],
)
print(storyboard.choices[0].message.content)兼容接口文档给出的配置是 Base URL、API Key 和 Model 三项。对于 minimax/minimax-h3 的视频生成,请在控制台确认当前的专用请求格式、任务查询方式和分辨率参数;不要把上面的文本接口误用为视频端点。
2. 固定实验变量再比较加速档位
固定提示词、随机种子、分辨率、帧率和去噪步数。
先跑 SGLang 无损基线,记录生成侧延迟和显存峰值。
再开启 Cache-DiT conservative,确认 SSIM 和主体一致性没有跌破业务阈值。
最后测试 SubBlock 0.75 或 0.80,并分别保存速度、SSIM 和人工偏好结果。
国内多模型 AI 推理 API 平台速查(2026年8月)
这张表中的 Token Plan 是订阅型多模型入口,MiniMax-H3 的视频单价仍应以模型详情页为准;两者不要混算成同一计费单位。
选型建议:按质量目标切换 profile
如果视频要进入广告、短片或角色连续性流程,先选择质量优先或平衡档,再用人工偏好验证 SSIM。 推荐顺序如下:
质量优先:SGLang 无损或仅使用 Cache-DiT conservative,接受约 1.85–2.99 倍加速。
平衡模式:SubBlock 0.75 + Cache-DiT stride,目标是 4.90–5.93 倍,并保留可接受的结构相似度。
速度优先:SubBlock 0.80 + stride,最高可到 6.24 倍,但必须抽样检查 T2VA 的细节和音画同步。
交互式预览:使用 H3 Max 这类服务化高速版本,把最终质量复核放到异步渲染队列。
三个容易误读的地方
“35 倍”不是所有 H3 部署都能拿到
35 倍来自 fal 将 H3 Max 与官方 H3 端点比较的吞吐结果;LMSYS 的 1.85–1.95 倍来自 8×H200 上 SGLang 与 Diffusers 的同条件比较。硬件、服务实现、并行方式和基线不同,工程评估应保留原始口径。
SSIM 高不等于人类一定更喜欢
SSIM 只描述与无损基线的帧级相似度。LMSYS 将它用于衡量有损加速代价,fal 则用人类偏好、提示词理解和审美做独立评测;上线前应同时保留两类指标。
生成时间不等于用户等待时间
模型加载、GPU 调度、排队、轮询和下载都可能超过纯生成时间。线上监控至少应拆成排队、首 token/首帧、生成完成和文件可用四段。
结语
LMSYS 2026 年 8 月的基准说明了 H3 推理优化的可复现路径:先拿到 1.85–1.95 倍无损收益,再按 SSIM 阈值叠加 Cache-DiT 和 SubBlock。
fal 同期的 H3 Max 公告则证明,模型后训练与推理系统协同可以把 5 秒视频压到约 3 秒。本文属于高时效内容,建议在 39 天内复测模型版本、价格和 API 协议。