MiniMax-H3
MiniMax-H3
MiniMax发布H3全模态生成系统,支持文本、图像、视频和音频的统一理解与生成,输出最高2K分辨率、15秒时长、32kHz立体声音频的视频。系统由H3-Context-IR、H3-Base(33B参数Omni-Transformer)和H3-Regenerate-2K三模块组成,支持11种语言。H3-Base以FL2VA和Ref2VA两个checkpoint形式开源,可通过SGLang、vLLM、diffusers和ComfyUI部署。
MiniMax H3
系统概述
MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文的统一理解,并能生成分辨率高达 2K、时长最长 15 秒、带有原生立体声音频的视频。得益于其面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解和生成能力,在遵循复杂多模态指令方面表现出色。
H3 支持以下输入和输出规格:
| 类别 | 规格 |
|---|---|
| 输出时长 | 4–15 秒 |
| 输出宽高比 | 支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16 |
| 输出分辨率 | 支持多种分辨率尺寸。默认将短边设置为 768 像素。通过 H3-Regenerate-2K 可实现 2K 生成 |
| 输出帧率 | 24 FPS |
| 输出音频 | 32 kHz 立体声 |
| 支持的对话语言 | 稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。其他语言也有不同程度的支持 |
模型变体与输入规格
| 模型变体 | 输入模式 | 规格 |
|---|---|---|
| H3-Base-FL2VA | 首尾帧模式 | 支持零张、一张或两张输入图像。- 无图像输入:文生视频模式- 单张图像输入:首帧生视频或尾帧生视频- 两张图像输入:首尾帧生视频 |
| H3-Base-Ref2VA | 全参考模式 | 支持多模态参考输入:- 图像: ≤ 9 张- 视频: ≤ 3 段;每段时长须为 2–15 秒;总时长 ≤ 15 秒- 音频: ≤ 3 段;音频必须伴随图像或视频输入,不能作为唯一输入;每段时长须为 2–15 秒;总时长 ≤ 15 秒- 混合输入: 所有输入类型的文件总数上限为 12 |
Image
完整的 H3 系统由以下三个模块组成:
- H3-Context-IR:随着输入日益复杂,我们构建了一个专用系统来深入理解和提炼输入的多模态指令,然后将其转换为 H3 易于理解的形式——上下文中间表示(Context Intermediate Representation)——用于生成。H3-Context-IR 对最终输出的质量至关重要,因此我们强烈建议将其纳入你的生成流程,或遵循“提示词指南”构建你自己的上下文处理系统。
- H3-Base:基于 H3-Context-IR 的输出生成音频和视频,以 768p 分辨率生成结果。
- H3-Regenerate-2K:将 768p 结果与原始上下文一起重新输入 H3,以 2K 分辨率重新生成输出。该过程同时利用了 H3 强大的生成能力和原始上下文中包含的丰富信息,使其能够生成细节更准确、视觉保真度更高的高分辨率输出。
在线 API
直接通过 API 使用 MiniMax-H3。
- 全球版:platform.minimax.io | 中国版:platform.minimaxi.com
在线应用
直接通过应用使用 MiniMax-H3。
Web 应用 全球版:hailuoai.video | 中国版:hailuoai.com
桌面端 全球版:hub.minimax.io | 中国版:hub.minimaxi.com
模型架构
H3-Context-IR
H3-Context-IR 是一个托管的预处理和编排系统,专为自由形式的多模态输入而设计。
它解释文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成输出之间的关联。其内部工作流程包括指令解析、跨模态关联、时间理解和复杂逻辑推理。
H3-Context-IR 将其对上下文的理解序列化为 H3-Base 可接受的结构化表示。在不偏离用户原始意图的前提下,它还可以在适当的地方补充缺失或未明确说明的语义细节。
由于 H3-Context-IR 依赖多阶段工作流以及多个托管模型和服务,因此不包含在此次开源发布中。我们提供 API,使用户能够复现官方工作流的行为。我们还提供了详细的教程,开发者可以按照提示词指南构建自己的预处理系统。
详细使用说明请参阅推荐工作流——完整 2K 工作流。
安全护栏
用户提交的文本、图像和视频以及增强后的提示词均需经过自动审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。我们采用行业标准的过滤措施,但无法消除误报或漏报。这些护栏不影响被许可方在 MiniMax H3 社区许可下的义务,尤其是与合法使用和使用限制相关的义务。
H3-Base
Image
架构概述
- H3-Base 使用相应的编码器或 VAE 对不同模态进行编码,并将编码后的表示组织成统一的打包多模态序列。在将整个序列传递给 H3-Omni-Transformer 之前,使用 RoPE 捕获 token 之间必要的空间和时间关系。
- 具体来说,文本由 H3-Encoder 编码;视觉输入由 H3-Encoder 和 H3-VisualVAE 共同编码;音频仅由 H3-AudioVAE 编码。
- H3-Omni-Transformer 联合预测视频和音频 latent,然后分别解码为视频和立体声音频。
- 为降低长多模态序列的计算成本,H3 原生支持稀疏注意力训练和推理。初始开源版本仅提供全注意力推理。我们的稀疏注意力实现将在未来更新中发布。
H3-Encoder
- H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,并将其第 50 层的隐藏状态提供给 H3-Omni-Transformer。
- 我们在 tokenizer 配置中添加了几个特殊 token,例如
<d>。使用 H3 时,需要使用 H3 仓库中提供的 tokenizer 及相关配置文件。
H3-VAE
H3 使用独立的视觉和音频 latent 来表示各自的模态。
H3-VisualVAE
- H3-VisualVAE 是一个时间因果视频自编码器,空间压缩因子为 16×,时间压缩因子为 4×,具有 24 个 latent 通道,记为 f16t4d24。我们应用了多种 latent 空间优化技术,以联合提升重建质量和 latent 可学习性。
- 在传递给 H3-Omni-Transformer 之前,视觉 latent 会沿
(时间, 高度, 宽度)维度以1 × 2 × 2的 patch 大小进一步分块。因此,进入 Transformer 的视觉 token 具有 32× 的有效空间下采样因子,而时间下采样因子保持为 4×。 - H3-VisualVAE 的 latent 空间针对重建质量和生成模型易学习性进行了优化。在训练其编码器后,我们还额外训练了一个基于 ViT 的解码器,以降低解码成本并进一步提高重建质量。
H3-AudioVAE
- H3-AudioVAE 对左右声道使用相同的编码器和解码器,同时独立处理每个声道。解码后的声道再重新组合,从而实现立体声音频的输入和输出。
- 对于每个声道,H3-AudioVAE 将 32 kHz 音频压缩为时间速率为 40 Hz 的 latent token 序列。
- 受 VA-VAE 启发,我们优化了 latent 空间,以在保持音频重建质量的同时,使生成模型更易于学习。
H3-Omni-Transformer
- 为了可扩展性和泛化性,我们采用了相对简单的 Transformer block 设计。H3-Omni-Transformer 是一个 33B 参数的稠密单流 Transformer,其中约 13B 参数位于 AdaLN 相关分支中。由于 AdaLN 调制输出可以预先计算并缓存,因此仅推理部署时无需加载这些参数。我们发布完整的模型权重以支持进一步开发,包括微调。
- 注意力层和 FFN 层均不包含模态特定结构。模态特定参数仅限于输入/输出层和 AdaLN 分支。特别是,模态特定 AdaLN 以相对较低的额外训练和推理成本提升了生成质量。
- 模型使用三维多模态旋转位置编码(MM-RoPE)来表示时间维度和两个空间维度
(t, h, w)上的位置关系。 - 在训练的最终阶段,我们引入了原生稀疏注意力以降低长序列的计算成本。稀疏注意力实现不包含在初始开源版本中,将在未来更新中单独发布。
H3-Regenerate-2K
- 对于 H3 的 2K 分辨率输出,我们没有使用传统的专用超分辨率模块,而是使用 H3 基础模型通过上下文内(in-context)方式重新生成其自身的低分辨率结果。
- 这种方法有两个优势:(1) 重新生成过程可以最大程度地复用 H3 基础模型的生成能力;(2) 上下文内格式在生成高分辨率输出时可以复用原始多模态上下文,从而恢复传统超分辨率方法必须“猜测”的信息,例如小文本和精细细节。
- 上下文内重新生成也是任务泛化的一个实例。
- 由于系统复杂性,该模块尚未开源。我们将在准备就绪后发布。 我们提供 API 用于验证官方结果;请参阅下文“完整 2K 工作流”。
推荐工作流
为帮助社区正确部署 MiniMax H3,我们提供两种验证方法。
由于完整的 H3 系统由三个模块组成——H3-Context-IR、H3-Base 和 H3-Regenerate-2K——“完整 2K 工作流”提供了一条端到端的 2K 输出验证流程,将开放平台 API 与本地部署的 H3-Base 相结合。“H3-Base 本地部署”部分提供了仅使用本地部署的 H3-Base 验证 768p 输出的方法。
此外,“提示词指南”部分提供了详细教程,帮助社区开发自己的提示词系统。
H3-Base 本地部署
MiniMax H3 以两个任务特定 checkpoint 的形式发布。每个 checkpoint 包含一个专用的 Omni Transformer 模型以及所需的 processor、tokenizer、文本编码器、Visual VAE 和独立的 Audio VAE 组件。
| Checkpoint | 支持的任务 | 输入条件 | 输出 | 精度 |
|---|---|---|---|---|
| MiniMax-H3 Base FL2VA | 文生音视频 (t2va)、首/尾帧生音视频 (fl2va) |
文本;可选首帧、尾帧或两者 | 视频和音频 | BF16 |
| MiniMax-H3 Base Ref2VA | 参考生音视频 (ref2va) |
带参考图像、视频和/或音频的文本 | 视频和音频 | BF16 |
发布的 checkpoint 是 CFG-distilled Omni Transformer 模型权重。
每个 checkpoint 以自包含的 Hugging Face 风格仓库形式分发,包含以下组件:
<TASK>/
├── model_index.json
├── processor/
├── tokenizer/
├── text_encoder/
├── transformer/
├── visual_vae/
└── audio_vae/
下载模型:
hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3
我们推荐以下推理框架来服务该模型:
vLLM - 参见 vllm recipes
diffusers - 参见 diffusers docs
Sglang 部署
这里我们以 sglang 作为部署示例。更多部署配置请参见 MiniMax-H3 部署指南。
FL2VA:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
Ref2VA:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30011 \
--model-variant ref2va
可复现的 768p 用例
以下 T2VA、FL2VA 和 Ref2VA 三个用例演示了如何复现 MiniMax-H3 视频音频生成。
| 用例 | 请求 | 结果 |
|---|---|---|
| T2VA | 查看脚本 | t2va.mp4 |
| FL2VA | 查看脚本 | fl2va.mp4 |
| Ref2VA | 查看脚本 | ref2va.mp4 |
完整 2K 工作流
本节说明如何将本地部署的 SGLang 服务与官方的 H3-Context-IR 和 H3-Regenerate-2K API 相结合,以复现直接通过 MiniMax API 生成的 2K 视频质量。 开始之前,请配置 SGLang 端点和你的 MiniMax API 凭据:
# 你的 SGLang 部署 URL
SGLANG_DEPLOYMENT_URL="<sglang-deployment-url>"
# MiniMax API 端点(选择其一)
# 中国版
MINIMAX_API_BASE="https://api.minimaxi.com"
# 全球版
# MINIMAX_API_BASE="https://api.minimax.io"
# 从 MiniMax 平台获取的 API token
TOKEN="<token>"
MiniMax 平台:
以下示例将本地 H3-Base 输出文件编码为 Base64 Data URL。对于生产环境,建议将视频上传到可公开访问的 URL,并将该 URL 作为 base_video 传入。
对于以下每个用例,我们都提供了直接通过开放平台 API 生成的 2K 和 768p 参考输出,便于验证结果。
case-T2VA
- 类型:文生视频
- 时长:10 秒
- 宽高比:16:9
case-I2VA
- 类型:首帧图生视频
- 时长:8 秒
- 宽高比:自适应
case-Ref2VA
- 类型:多模态参考生视频(视频 + 音频)
- 时长:5 秒
- 宽高比:自适应
提示词指南
VIDEO_PROMPT_WRITING_GUIDE_base_en.md
VIDEO_PROMPT_WRITING_GUIDE_ref_en.md
许可证
MiniMax H3 根据 MiniMax H3 社区许可协议 发布。许可证问答
联系我们
通过 model@minimax.io 联系我们。