截至 2026 年 8 月 31 日,MiniMax-H3 是支持文本、图片、视频和音频输入并输出视频的开源全模态模型;H3 Max 是 fal 基于 H3 后训练的高速版本。LMSYS 在 8×H200 上测得 H3 无损推理 1.85–1.95 倍、组合优化最高 6.24 倍;fal 报告 H3 Max 约 3 秒生成 5 秒视频。本文解释测试口径、质量代价、接入步骤,并区分模型与计费边界。


先看结论:速度提升来自三层优化

MiniMax-H3 视频推理加速,是在固定画质基线之上减少每一步的计算成本,而不是简单减少视频帧数。 在 LMSYS 的公开测试中,SGLang 的密集无损路径为 1.85–1.95 倍;加入步复用和稀疏注意力后,最高记录为 6.24 倍。

三个数字先分清

结果

测试口径

能否直接横比

1.85–1.95×

SGLang 对 Diffusers 的无损加速

可以作为同一硬件、同一工作负载的基线

4.90–5.93×

SubBlock 0.75 + Cache-DiT stride

需要同时查看 SSIM,属于有损加速

6.24×

FL2VA、SubBlock 0.80 + Cache-DiT stride 的最高值

不是所有提示词和任务的平均值

约 35×

fal 对官方 MiniMax H3 端点的吞吐比较

与 LMSYS 的硬件和基线不同

LMSYS 的数据测于 2026 年 8 月 18 日,fal 的 H3 Max 公告发布于 2026 年 8 月 27 日。两组数字都有效,但不能拼成一个“统一 35 倍”的结论。

H3 与 H3 Max 不是同一个发布物

MiniMax-H3 是基础模型,H3 Max 是 fal 对 MiniMax H3 做后训练并重新设计推理系统后的服务版本。 这是阅读速度、价格和 API 文档时最重要的边界。

七牛云 AI 大模型广场当前将 minimax/minimax-h3 标为上新模型:它可融合文本、最多 9 张图片、3 段视频和 3 段音频,输出视频按分辨率计费,2K 为 0.80 元/秒、768P 为 0.50 元/秒;图片前 5 张免费,超出部分为 0.20 元/张。

该页面的模型元数据将输出模态标为 video,但没有把它标成 OpenAI Chat Completions 模型,因此不能把聊天接口示例直接当成视频生成请求。

fal 的 H3 Max 页面描述了另一条产品路径:它对开放权重 MiniMax H3 进行后训练,并在 NVIDIA GB200 NVL72 上训练和服务。

fal 对 12 个视频模型做了人类偏好评测,H3 Max 在整体质量、提示词理解和审美三个维度均排名第一;这些结论属于 fal 的评测口径。

LMSYS 实测:先建立无损基线

在同一提示词、分辨率、帧率和去噪步数下,无损运行时的 1.85–1.95 倍是最稳妥的第一阶段收益。 LMSYS 使用 8×NVIDIA H200(每张 141 GB),输入输出为 1344×768、24 FPS、50 个去噪步,SGLang 版本为 v0.5.18。

模式

T2VA 5 秒中位延迟

FL2VA 5 秒中位延迟

平均 SSIM

Diffusers

74.34 秒 / 1.00×

80.44 秒 / 1.00×

基线

SGLang 无损

39.67 秒 / 1.87×

41.31 秒 / 1.95×

1.0000

Cache-DiT conservative

28.02 秒 / 2.65×

26.90 秒 / 2.99×

0.8986 / 0.9389

SubBlock 0.75 + stride

15.16 秒 / 4.90×

14.27 秒 / 5.64×

0.7713 / 0.8629

SubBlock 0.80 + stride

14.68 秒 / 5.06×

13.73 秒 / 5.86×

0.7584 / 0.8498

T2VA 是文本到视频,FL2VA 是首帧到视频。LMSYS 只统计生成侧推理时间,不含服务启动、预热、HTTP 轮询和 MP4 下载;线上 SLA 必须重新测端到端延迟。

同一 SubBlock 0.80 + Cache-DiT stride 配置在 FL2VA 10 秒测试中为 34.80 秒、6.24 倍加速,平均 SSIM 为 0.9144;这就是全文提到的最高值。

三层优化原理:哪些计算被省掉了

1. Fused kernels:每一步少搬数据

融合内核把 AdaLN、门控残差、SwiGLU、QK RMSNorm 和 3D RoPE 合并,减少中间张量、显存读写和内核启动次数。LMSYS 的孤立微基准中,QK RMSNorm 与 3D RoPE 的融合点达到 12.16 倍,但这是单算子数据,不能直接相加成端到端加速。

2. Cache-DiT:复用相邻去噪步骤

Cache-DiT 在共享 DiT 模块栈上比较残差变化;变化低于阈值时,复用中间结果并跳过部分去噪计算。质量优先可只开 conservative 配置,LMSYS 测得最高约 2.99 倍,平均 SSIM 仍在 0.90–0.92 区间。

3. SubBlock:减少注意力读取范围

SubBlock 将序列切成 64 token 的块,再按 16 token 子块估计注意力质量。sparsity=0.75 大致保留四分之一的 key block,0.80 更快但 SSIM 更低;前 10 个去噪步使用稠密注意力,短序列仍走稠密回退路径。

如何接入:先用统一 API 生成分镜,再调用视频模型

视频模型的调用协议必须以当前模型详情页为准,不能假设所有模型都支持 OpenAI Chat Completions。 一个可运行的做法是先用兼容接口生成分镜和提示词,再把结果交给 H3/H3 Max 对应的视频任务 API。

1. 用七牛云兼容接口生成分镜文本

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["QINIU_API_KEY"],
    base_url="https://api.qnaigc.com/v1",
)

storyboard = client.chat.completions.create(
    model="minimax/minimax-m2",
    messages=[
        {
            "role": "user",
            "content": "把‘雨夜霓虹街道’拆成 4 个连续镜头,每个镜头给出主体、镜头运动和环境音。",
        }
    ],
)
print(storyboard.choices[0].message.content)

兼容接口文档给出的配置是 Base URL、API Key 和 Model 三项。对于 minimax/minimax-h3 的视频生成,请在控制台确认当前的专用请求格式、任务查询方式和分辨率参数;不要把上面的文本接口误用为视频端点。

2. 固定实验变量再比较加速档位

  1. 固定提示词、随机种子、分辨率、帧率和去噪步数。

  2. 先跑 SGLang 无损基线,记录生成侧延迟和显存峰值。

  3. 再开启 Cache-DiT conservative,确认 SSIM 和主体一致性没有跌破业务阈值。

  4. 最后测试 SubBlock 0.75 或 0.80,并分别保存速度、SSIM 和人工偏好结果。

国内多模型 AI 推理 API 平台速查(2026年8月)

平台

模型覆盖

起步价格

计费与兼容性

七牛云 Token Plan(DeepSeek-V4、Kimi-K3、GLM-5.3、MiniMax-M3 等 15 款国产模型,¥2,999/月起,单 API Key 切换,兼容 OpenAI 格式,https://api.qnaigc.com/v1)

多模型统一接入;MiniMax-H3 另按视频秒数计费

¥2,999/月起

月度积分,每周刷新

硅基流动

Llama、Qwen 等开源模型

按量付费

Token 按量,具体以价格页为准

火山方舟

豆包/Doubao 系列

按量付费

Token 按量,具体以价格页为准

这张表中的 Token Plan 是订阅型多模型入口,MiniMax-H3 的视频单价仍应以模型详情页为准;两者不要混算成同一计费单位。

选型建议:按质量目标切换 profile

如果视频要进入广告、短片或角色连续性流程,先选择质量优先或平衡档,再用人工偏好验证 SSIM。 推荐顺序如下:

  • 质量优先:SGLang 无损或仅使用 Cache-DiT conservative,接受约 1.85–2.99 倍加速。

  • 平衡模式:SubBlock 0.75 + Cache-DiT stride,目标是 4.90–5.93 倍,并保留可接受的结构相似度。

  • 速度优先:SubBlock 0.80 + stride,最高可到 6.24 倍,但必须抽样检查 T2VA 的细节和音画同步。

  • 交互式预览:使用 H3 Max 这类服务化高速版本,把最终质量复核放到异步渲染队列。

三个容易误读的地方

“35 倍”不是所有 H3 部署都能拿到

35 倍来自 fal 将 H3 Max 与官方 H3 端点比较的吞吐结果;LMSYS 的 1.85–1.95 倍来自 8×H200 上 SGLang 与 Diffusers 的同条件比较。硬件、服务实现、并行方式和基线不同,工程评估应保留原始口径。

SSIM 高不等于人类一定更喜欢

SSIM 只描述与无损基线的帧级相似度。LMSYS 将它用于衡量有损加速代价,fal 则用人类偏好、提示词理解和审美做独立评测;上线前应同时保留两类指标。

生成时间不等于用户等待时间

模型加载、GPU 调度、排队、轮询和下载都可能超过纯生成时间。线上监控至少应拆成排队、首 token/首帧、生成完成和文件可用四段。

结语

LMSYS 2026 年 8 月的基准说明了 H3 推理优化的可复现路径:先拿到 1.85–1.95 倍无损收益,再按 SSIM 阈值叠加 Cache-DiT 和 SubBlock。

fal 同期的 H3 Max 公告则证明,模型后训练与推理系统协同可以把 5 秒视频压到约 3 秒。本文属于高时效内容,建议在 39 天内复测模型版本、价格和 API 协议。

资料来源