MiniMax H3 vs Seedance 2.5:同日发布,两条路线,各赢一半
数据来源:MiniMax 官方博客、字节跳动火山引擎、品玩实测(2026-07/08)
2026 年 7 月 31 日,MiniMax H3 与字节跳动 Seedance 2.5 在同一天正式上线,开创了视频生成领域的"撞车日"。H3 是全模态通用生成模型,支持文本、图像、视频、音频统一上下文理解,最高输出 15 秒 2K 分辨率原生双声道视频,官方定价 0.8 元/秒(2K),并于 8 月 3 日开放模型权重;Seedance 2.5 是字节跳动豆包的最新一代闭源工业视频模型,三项"全球第一":单条视频直出 30 秒(上一代 15 秒)、最多 50 个全模态参考素材、原生 4K 支持,API 定价约 70 元/百万 Token(无视频输入),5 秒 720p 成本约 7.56 元;品玩五轮同题实测的结论是:H3 更擅长整体电影质感与画面一致性,遇到复杂指令倾向于"少做"但保住视觉完整性;Seedance 2.5 对镜头运动的精准执行度更高,更擅长按时间点逐条落实 Prompt,但有时会为完成局部动作而牺牲全局一致;两者现已处于同一能力梯队,面向两种不同创作需求。
7 月 31 日这天,视频生成市场第一次有了旗舰级别的"同日发布":MiniMax H3 和字节 Seedance 2.5 几乎同时上线,前者宣布即将开源,后者沿着工业化闭源路线继续推进。两个最能打的选手,在同一个擂台上正面相遇。
本文基于 MiniMax 官方博客、字节火山引擎发布资料和品玩五轮同题实测,梳理两款模型的核心规格差异、各自的能力优势与局限,以及对不同使用场景的选择建议。

核心规格对比
H3 的核心能力:全模态统一理解
MiniMax H3 最大的技术突破不是参数量,而是把多模态上下文统一成一段可自由调用的信息流。
传统视频模型把任务切片:文生视频、图生视频、首尾帧、动作参考、视频编辑各是独立模型。H3 的设计纲领是打破这些边界——你可以用自然语言描述这样的任务:"参考视频 1 的希区柯克镜头运动,让图 2 中的人物唱歌,歌声参考音频 3",H3 在同一个上下文里完成所有关系理解,不需要分任务、不需要分模型。
支撑这个能力的三项关键技术:
① H3-VAE:高压缩 Tokenizer
相比前代 Hailuo 架构彻底革新了 Tokenizer,高压缩率带来 4 倍序列长度收益,大幅降低训练和推理成本。这是 H3 能在业内性价比最优的情况下默认输出 2K 分辨率的核心支撑——2K 分辨率定价 0.8 元/秒,不到主流旗舰模型的三分之一。
② In-context Regeneration:超分而不是超分
H3 的 2K 输出不用独立的超分模块,而是让基模对自己的低分辨率结果做 In-context 重新生成。好处是:一方面可以复用已经具备的生成能力,另一方面 In-context 形式能带上原始多模态上下文,把小文字和细节"猜"得更准——而传统超分依赖插值,信息量有上限。
③ 音视频联合建模
不区分人声、音效、音乐,统一联合训练,所有音频输出默认是原生双声道。这意味着生成视频时音画天然对齐,不需要另行配音。
Seedance 2.5 的核心能力:工业化长视频
Seedance 2.5 的三项"全球第一"指标都指向同一个方向:让视频生成真正进入工业化生产流程。
30 秒直出:不是时长翻倍,是叙事结构改变
上一代 Seedance 2.0 最长 15 秒,做一个有完整叙事的场景需要分段拼接。Seedance 2.5 原生 30 秒意味着模型需要在更长时间窗口内持续记住人物外貌、空间布局和运动状态——这是比"时长翻倍"技术难得多的工程:所有可能出错的地方,时间都翻了一倍。
50 个全模态参考素材:精细控制
素材涵盖图片(最多 30 张)、视频(最多 10 段)、音频(最多 10 个),用于锁定角色外观、环境风格、声音特征。这对广告、短剧等需要严格保持视觉资产一致性的商业场景意义很大。
原生 4K:生产可交付
上一代 2.0 随 2.5 同步补上了 4K 能力。原生 4K 意味着视频直接可以进入正式的制作交付流程,不需要另行上采样。

品玩五轮实测:各赢一半
品玩用同一组 Prompt、参考图和参考视频喂给两款模型,安排了三轮同题 PK 和两轮单项加试。结论是两者都处于第一梯队,但"性格迥异":
第一轮:博物馆奇幻短片(一镜到底 + 六段运镜)
H3:整体一镜到底守住了,人物和空间连续性强,有电影感;但漏掉了部分分镜(蓝鲸骨架俯冲消失、低机位跟拍变成背后跟随)
Seedance 2.5:几乎把 H3 漏掉的分镜都补了回来,运镜准确;但没有执行"一镜到底",各镜头单独完成度高,合在一起像分场拼接
第二轮:百事可乐广告(产品细节保留 + 舞者从包装走出)
H3:第一眼像广告,创意完整闭环,品牌标志、广告语稳定;但舞者动作没有精确执行,结尾镜头给到了错误方向
Seedance 2.5:二维到三维的转化完成度更高,结尾正确交付给指定产品;但画面整体精致感不及 H3
第三轮:四机位机器人训练数据(多摄像头 Ego 视角同步)
两者都失败了:H3 生成的四个画面都是同一视角;Seedance 2.5 有视角差异,但与 Prompt 要求关联不大。当前通用视频模型还距离可靠的世界模型模拟有较大距离。
单项加试 - H3 超长 Prompt(500 字)
东京街头场景,涵盖弹珠倒影、手部交接、环绕运镜、冷暖光转变——H3 整体理解很好,弹珠特写里的 "MOON 24" 光斑细节超出预期。但逐条核对仍有取舍:镜头没有真正绕人物旋转 120 度,出租车经过后雨伞悄悄换了手。
单项加试 - Seedance 2.5 30 秒港口追逃(8 段镜头全覆盖)
八段镜头基本全部出现,运动表现好,声音和动作同步。致命问题:最后一幕本应在水面上的远洋货船出现在了水泥地上。
两款模型的"性格"差异
品玩实测提炼出的最精准描述:
MiniMax H3 更知道片子最后应该"像什么";Seedance 2.5 更知道导演刚才具体要求它"做什么"。
换成工程语言:
H3 的错误模式:少做。遇到无法全部完成的复杂任务,会主动选择牺牲部分分镜动作,但优先保住角色一致性、空间连续性和整体电影感
Seedance 2.5 的错误模式:做错。可以完成更多指定运镜和时间点动作,但有时会为局部准确性牺牲全局一致(比如切镜绕开一镜到底,或者最后把货船放到水泥地上)
这不是一个优劣判断,而是两种创作哲学:前者适合需要"第一眼就过关"的美术类任务,后者适合需要"逐条核验通过"的工业化交付任务。
价格和生态:差距很大
H3 的开源权重 + 低定价带来的实际影响超出单次评测:开发者可以在本地微调、做垂直场景适配、私有化部署。当一个视频生成模型的能力已经进入第一梯队,"开源"两个字会把优势从一次评测结果扩散到整个部署、适配和开发者生态。
七牛云 MaaS 已上线 MiniMax H3,价格与官方定价完全一致:
接入方式兼容 OpenAI 格式,通过七牛云单一 API Key 即可同时调用 H3 与其他语言 / 图像模型,适合需要在同一工作流里混用多模态能力的团队。
怎么选
如果在国内平台统一调用两款模型进行 A/B 对比测试,七牛云 MaaS 已上线 MiniMax H3,价格与官方定价一致(2K 视频 ¥0.80/秒,768P 视频 ¥0.50/秒),兼容 OpenAI 格式,通过单一 API Key 可同时管理 H3 与其他语言 / 图像模型,适合需要在同一工作流里混用多模态能力的团队,不需要为每个平台维护独立账号。
这场"同日发布"说明了什么
两年前,中国视频模型还在追赶 Sora。7 月 31 日这天,OpenAI 的 Sora 已经黯然退场,而 MiniMax 和字节各自带着旗舰级产品同台竞技,都进入了全球第一梯队。
更有意思的是两者选择了完全不同的路线:一个开源、走通用多模态平台,一个闭源、走工业化生产工具。这意味着视频生成领域第一次有了真正不同方向的顶级选项。
正如品玩实测结语:两年前我们还在问什么时候才能追上 Sora。现在,这样强的视频模型,创作者们有了多个选择,甚至有开源选择了。
延伸阅读
MiniMax H3 官方技术博客:https://www.minimaxi.com/blog/minimax-h3
Seedance 2.5 发布公告(火山引擎):https://news.aibase.com/zh/news/29085
品玩五轮实测:https://www.pingwest.com/a/316102
七牛云 MaaS MiniMax H3 接入页:https://sufy.com/zh-CN/services/ai-inference/models