MiniMax · HF

MiniMax-H3

MiniMax-H3

二〇二六年八月二十六日 · 英文原文

MiniMax发布H3全模态生成系统,支持文本、图像、视频和音频的统一理解与生成,输出最高2K分辨率、15秒时长、32kHz立体声音频的视频。系统由H3-Context-IR、H3-Base(33B参数Omni-Transformer)和H3-Regenerate-2K三模块组成,支持11种语言。H3-Base以FL2VA和Ref2VA两个checkpoint形式开源,可通过SGLang、vLLM、diffusers和ComfyUI部署。

MiniMax H3

系统概述

MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文的统一理解,并能生成分辨率高达 2K、时长最长 15 秒、带有原生立体声音频的视频。得益于其面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解和生成能力,在遵循复杂多模态指令方面表现出色。

H3 支持以下输入和输出规格:

类别 规格
输出时长 4–15 秒
输出宽高比 支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16
输出分辨率 支持多种分辨率尺寸。默认将短边设置为 768 像素。通过 H3-Regenerate-2K 可实现 2K 生成
输出帧率 24 FPS
输出音频 32 kHz 立体声
支持的对话语言 稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。其他语言也有不同程度的支持

模型变体与输入规格

模型变体 输入模式 规格
H3-Base-FL2VA 首尾帧模式 支持零张、一张或两张输入图像。- 无图像输入:文生视频模式- 单张图像输入:首帧生视频或尾帧生视频- 两张图像输入:首尾帧生视频
H3-Base-Ref2VA 全参考模式 支持多模态参考输入:- 图像: ≤ 9 张- 视频: ≤ 3 段;每段时长须为 2–15 秒;总时长 ≤ 15 秒- 音频: ≤ 3 段;音频必须伴随图像或视频输入,不能作为唯一输入;每段时长须为 2–15 秒;总时长 ≤ 15 秒- 混合输入: 所有输入类型的文件总数上限为 12

Image

完整的 H3 系统由以下三个模块组成:

在线 API

直接通过 API 使用 MiniMax-H3。

在线应用

直接通过应用使用 MiniMax-H3。

模型架构

H3-Context-IR

H3-Context-IR 是一个托管的预处理和编排系统,专为自由形式的多模态输入而设计。

它解释文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成输出之间的关联。其内部工作流程包括指令解析、跨模态关联、时间理解和复杂逻辑推理。

H3-Context-IR 将其对上下文的理解序列化为 H3-Base 可接受的结构化表示。在不偏离用户原始意图的前提下,它还可以在适当的地方补充缺失或未明确说明的语义细节。

由于 H3-Context-IR 依赖多阶段工作流以及多个托管模型和服务,因此不包含在此次开源发布中。我们提供 API,使用户能够复现官方工作流的行为。我们还提供了详细的教程,开发者可以按照提示词指南构建自己的预处理系统。

详细使用说明请参阅推荐工作流——完整 2K 工作流

安全护栏

用户提交的文本、图像和视频以及增强后的提示词均需经过自动审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。我们采用行业标准的过滤措施,但无法消除误报或漏报。这些护栏不影响被许可方在 MiniMax H3 社区许可下的义务,尤其是与合法使用和使用限制相关的义务。

H3-Base

Image

架构概述

H3-Encoder

H3-VAE

H3 使用独立的视觉和音频 latent 来表示各自的模态。

H3-VisualVAE
H3-AudioVAE

H3-Omni-Transformer

H3-Regenerate-2K

推荐工作流

为帮助社区正确部署 MiniMax H3,我们提供两种验证方法。

由于完整的 H3 系统由三个模块组成——H3-Context-IR、H3-Base 和 H3-Regenerate-2K——“完整 2K 工作流”提供了一条端到端的 2K 输出验证流程,将开放平台 API 与本地部署的 H3-Base 相结合。“H3-Base 本地部署”部分提供了仅使用本地部署的 H3-Base 验证 768p 输出的方法。

此外,“提示词指南”部分提供了详细教程,帮助社区开发自己的提示词系统。

H3-Base 本地部署

MiniMax H3 以两个任务特定 checkpoint 的形式发布。每个 checkpoint 包含一个专用的 Omni Transformer 模型以及所需的 processor、tokenizer、文本编码器、Visual VAE 和独立的 Audio VAE 组件。

Checkpoint 支持的任务 输入条件 输出 精度
MiniMax-H3 Base FL2VA 文生音视频 (t2va)、首/尾帧生音视频 (fl2va) 文本;可选首帧、尾帧或两者 视频和音频 BF16
MiniMax-H3 Base Ref2VA 参考生音视频 (ref2va) 带参考图像、视频和/或音频的文本 视频和音频 BF16

发布的 checkpoint 是 CFG-distilled Omni Transformer 模型权重。

每个 checkpoint 以自包含的 Hugging Face 风格仓库形式分发,包含以下组件:

<TASK>/
├── model_index.json
├── processor/
├── tokenizer/
├── text_encoder/
├── transformer/
├── visual_vae/
└── audio_vae/

下载模型:

hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3

我们推荐以下推理框架来服务该模型:

Sglang 部署

这里我们以 sglang 作为部署示例。更多部署配置请参见 MiniMax-H3 部署指南

FL2VA:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

Ref2VA:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30011 \
  --model-variant ref2va

可复现的 768p 用例

以下 T2VA、FL2VA 和 Ref2VA 三个用例演示了如何复现 MiniMax-H3 视频音频生成。

用例 请求 结果
T2VA 查看脚本 t2va.mp4
FL2VA 查看脚本 fl2va.mp4
Ref2VA 查看脚本 ref2va.mp4

完整 2K 工作流

本节说明如何将本地部署的 SGLang 服务与官方的 H3-Context-IRH3-Regenerate-2K API 相结合,以复现直接通过 MiniMax API 生成的 2K 视频质量。 开始之前,请配置 SGLang 端点和你的 MiniMax API 凭据:

# 你的 SGLang 部署 URL
SGLANG_DEPLOYMENT_URL="<sglang-deployment-url>"

# MiniMax API 端点(选择其一)
# 中国版
MINIMAX_API_BASE="https://api.minimaxi.com"
# 全球版
# MINIMAX_API_BASE="https://api.minimax.io"

# 从 MiniMax 平台获取的 API token
TOKEN="<token>"

MiniMax 平台:

以下示例将本地 H3-Base 输出文件编码为 Base64 Data URL。对于生产环境,建议将视频上传到可公开访问的 URL,并将该 URL 作为 base_video 传入。

对于以下每个用例,我们都提供了直接通过开放平台 API 生成的 2K 和 768p 参考输出,便于验证结果。

case-T2VA

case-I2VA

case-Ref2VA

提示词指南

VIDEO_PROMPT_WRITING_GUIDE_base_en.md

VIDEO_PROMPT_WRITING_GUIDE_ref_en.md

许可证

MiniMax H3 根据 MiniMax H3 社区许可协议 发布。许可证问答

联系我们

通过 model@minimax.io 联系我们。

译自 MiniMax · HF · 录于 二〇二六年八月二十六日