网易首页 > 网易号 > 正文 申请入驻

开放通用智能,MiniMax H3 正式开源

0
分享至

今天我们正式开源了新一代通用视频模型 MiniMax H3。

本文篇幅较长,以下为全文目录,供大家按需阅读。

  • 模型概览

  • 模型架构

    • H3-Context-IR

    • H3-Base

      · H3-Encoder

      · H3-VAE

      · H3-Omni-Transformer

    • H3-Regenerate-2K

  • 推荐工作流程

    • 提示词指南

  • 许可协议

模型概览

MiniMax H3 是一个通用型全模态生成系统。它能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。得益于以任务泛化为导向的系统设计,H3 在预训练阶段便已具备广泛的多模态上下文理解与生成能力,因此能够出色地遵循复杂的多模态指令。

H3 支持以下输入与输出规格:

  • 输出时长:4–15 秒

  • 输出宽高比:支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16

  • 输出分辨率:支持多种分辨率尺寸,默认将较短边设置为 768 像素。使用 H3-Regenerate-2K 可实现 2K 分辨率生成

  • 输出帧率:24 FPS

  • 输出音频:32 kHz 立体声

  • 支持的对话语言:稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。对于其他语言,也提供不同程度的支持。

模型版本与输入规格:

① H3-Base-FL2VA

首尾帧模式:支持输入 0 张、1 张或 2 张图像:

  • 不输入图像时,为文生视频模式;

  • 输入首帧图像时,为首帧生视频模式;

  • 输入尾帧图像时,为尾帧生视频模式;

  • 同时输入首帧和尾帧图像时,为首尾帧生视频模式

② H3-Base-Ref2VA

全模态参考模式:

  • 图像:最多 9 张;

  • 视频:最多 3 段;每段时长须为 2–15 秒,总时长不超过 15 秒;

  • 音频:最多 3 段。音频必须与图像或视频一同输入,不能作为唯一输入;每段时长须为 2–15 秒,总时长不超过 15 秒;

  • 混合输入:所有类型输入文件合计最多 12 个


完整的 H3 系统由以下三个模块组成:

  • H3-Context-IR:随着输入日益复杂,我们构建了一套专门的系统,用于深入理解和提炼输入的多模态指令,并将其转换为 H3 更易于理解、可直接用于生成的形式,即 Context Intermediate Representation(上下文中间表示)。H3-Context-IR 对最终输出质量非常重要。因此我们强烈建议将 H3-Context-IR API 接入生成流程。或者,可参考提示词指南搭建自己的上下文处理系统。

  • H3-Base根据 H3-Context-IR 的输出生成音频和视频,并输出 768p 分辨率的结果。

  • H3-Regenerate-2K将 768p 的生成结果连同原始上下文一并送回 H3,以 2K 分辨率重新生成输出。这既发挥了 H3 强大的生成能力,又充分利用了原始上下文中蕴含的丰富信息,从而生成细节更准确、视觉保真度更高的高分辨率结果。

模型架构

H3-Context-IR

H3-Context-IR 是一套托管式预处理与编排系统,专为自由形式的多模态输入而设计。

它能够理解文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成结果之间的关系。其内部工作流包括指令解析、跨模态关联、时序理解和复杂逻辑推理。

H3-Context-IR 会将其对上下文的理解序列化为一种 H3-Base 可接收的结构化表示。在不偏离用户原始意图的前提下,它也可能在适当情况下补充缺失或描述不充分的语义细节。

由于 H3-Context-IR 依赖多阶段工作流,以及多个托管模型与服务,因此不包含在本次开源发布中。我们提供了 API,帮助用户复现官方工作流的行为。同时,我们也提供了详细教程,开发者可以参考提示词指南(链接见下方),构建自己的预处理系统。

视频提示词写作指南:huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md

全参考模式输出指南:huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md

详细使用说明请参阅「推荐工作流——完整 2K 工作流」。

在安全防护机制上,用户提交的文本、图像和视频,以及经过增强的 Prompt,均会接受自动化内容审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被拦截。我们采用行业标准的过滤措施,但无法完全避免误判或漏判。上述安全防护机制不影响被许可方在MiniMax H3 Community License下应承担的义务,尤其是与合法使用和使用限制相关的义务。

H3-Base


架构概览:

H3-Base 使用不同模态各自对应的编码器或 VAE 进行编码,并将编码后的表示组织成统一的 packed multimodal sequence。随后,通过 RoPE 表达 token 之间必要的空间和时间关系,再将整个序列输入 H3-Omni-Transformer。

具体而言,文本由 H3-Encoder 编码;视觉输入同时由 H3-Encoder 和 H3-VisualVAE 编码;音频则仅由 H3-AudioVAE 编码。

H3-Omni-Transformer 联合预测视频 latent 和音频 latent,随后分别将其解码为视频和立体声音频。

为降低长多模态序列的计算开销,H3 原生支持稀疏注意力训练与推理。首个开源版本仅提供全注意力推理。我们的稀疏注意力实现将在后续更新中发布。

H3-Encoder:

H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,并将其第 50 层的 hidden states 提供给 H3-Omni-Transformer。

我们在 tokenizer 配置中增加了若干 special tokens,例如 。使用 H3 时,需要采用 H3 仓库中提供的 tokenizer 及相关配置文件。

H3-VAE:

H3 分别使用独立的视觉 latent 和音频 latent 来表示对应模态。

① H3-VisualVAE

  • H3-VisualVAE 是一个采用时间因果结构的视频自编码器,空间压缩倍率为 16 倍,时间压缩倍率为 4 倍,latent channel 数量为 24,记作f16t4d24。我们采用了多种 latent space 优化技术,以同时提升重建质量和 latent 的可学习性。

  • 在输入 H3-Omni-Transformer 之前,视觉 latent 会按照时间、高度和宽度三个维度,以1 × 2 × 2的 patch size 进一步进行 patchify。因此,进入 Transformer 的视觉 token 具有等效 32 倍的空间下采样倍率,而时间下采样倍率仍保持为 4 倍。

  • H3-VisualVAE 的 latent space 同时针对重建质量和生成模型的易学性进行了优化。在完成 encoder 训练后,我们还进一步训练了一个基于 ViT 的 decoder,以降低解码成本,并进一步提升重建质量。

② H3-AudioVAE

  • H3-AudioVAE 使用同一套编码器和解码器分别独立处理左、右音频声道,再将解码后的两个声道重新组合,从而支持立体声音频的输入与输出。

  • 对于每个声道,H3-AudioVAE 会将 32 kHz 音频压缩为时间频率为 40 Hz 的 latent token 序列。

  • 受 VA-VAE 启发,我们对 latent space 进行优化,在保持音频重建质量的同时,使生成模型更容易学习。

H3-Omni-Transformer:

为了实现可扩展性和泛化性,我们采用了相对简洁的 Transformer block 设计。H3-Omni-Transformer 是一个拥有 33B 参数的 dense、single-stream Transformer,其中约 13B 参数位于与 AdaLN 相关的分支中。由于 AdaLN 的调制输出可以预先计算并缓存,因此在仅用于推理的部署中,无需加载这部分参数。我们发布了完整模型权重,以支持包括微调在内的进一步开发。

attention 层和 FFN 层均不包含 modality-specific 结构。与模态相关的参数仅存在于 input/output layer 和 AdaLN 分支中。特别是,modality-specific AdaLN 能够以相对较低的额外训练和推理成本提升生成质量。

模型使用三维 Multimodal Rotary Position Embeddings(MM-RoPE),表达时间维度和两个空间维度,即(t, h, w)上的位置关系。

在训练的最后阶段,我们引入了原生稀疏注意力,以降低长序列的计算开销。稀疏注意力实现未包含在首个开源版本中,将在后续更新中单独发布。

H3-Regenerate-2K

对于 H3 的 2K 分辨率输出,我们没有采用传统的专用超分辨率模块,而是通过 in-context 的方式,使用 H3 基础模型对其自身生成的低分辨率结果进行重新生成。

这一方法具有两方面优势:

  • 再生成过程能够最大限度地复用 H3 基础模型已有的生成能力;

  • In-context 的形式能够在生成高分辨率输出时再次利用原始多模态上下文,从而还原传统超分辨率方法只能依靠“猜测”来补充的信息,例如小文字和精细细节。

In-context regeneration 也是任务泛化的一个例子。

由于系统较为复杂,该模块目前尚未开源。目前我们正在抓紧完成开源这个模块所需的大量工作,一旦就绪,会第一时间开放给大家。我们同时提供了一个API,可用于复现并验证官方的完整生成结果,具体请参阅下方的完整 2K 工作流。

推荐工作流

为了帮助社区正确部署 MiniMax H3,我们提供了两种验证方法。

完整的 H3 系统由 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块组成。因此,“完整 2K 工作流”结合开放平台 API 与本地部署的 H3-Base,提供了一套用于验证 2K 输出的端到端流程。“H3-Base 本地部署”部分则介绍了如何仅使用本地部署的 H3-Base,对 768p 输出进行验证。

此外,我们也提供了提示词指南,供开发者进一步参考。

H3-Base 本地部署

MiniMax H3 以两个 task-specific checkpoints 的形式发布。每个 checkpoint 均包含针对相应任务训练的 Omni Transformer Model,以及推理所需的 processor、tokenizer、text encoder、Visual VAE 和独立 Audio VAE。


发布的 checkpoint 均采用针对具体任务进行 CFG Distillation 的 Omni Transformer 权重。每个 checkpoint 均以 self-contained 的 Hugging Face 模型仓库发布,包含以下组件:processor、tokenizer、text encoder、Omni Transformer、Visual VAE、Audio VAE

开发者可以直接从 Hugging Face 下载模型。H3-Base 目前支持通过SGLang、vLLM、diffusers 和 ComfyUI等推理框架和工作流进行部署。

以 SGLang 为例,我们分别提供了 FL2VA 和 Ref2VA 两个 checkpoint 的服务启动配置。其中,FL2VA checkpoint 支持 T2VA 和 FL2VA 任务;Ref2VA checkpoint 支持基于参考图像、视频和音频的 Ref2VA 任务。开发者可根据具体任务选择相应的 model variant,并通过多 GPU 并行完成本地推理。

为帮助社区验证部署结果,我们同时提供了 T2VA、FL2VA 和 Ref2VA 三类可复现的 768p 音视频生成案例:

  • T2VA:输入完整的 H3-Context-IR Prompt,直接生成包含画面、环境音、音效与配乐的音视频内容;

  • FL2VA:以首帧、尾帧或首尾帧作为 keyframe,根据 H3-Context-IR Prompt 生成后续音视频内容。

  • Ref2VA:联合使用参考图像、视频和音频,实现人物与场景保留、动作与嘴型编辑、音色参考、原始音频复用等复合任务。

在 Ref2VA 示例中,模型保留了原视频中的人物身份、服装、镜头构图、光线和场景,并部分复用原视频的背景音乐;同时参考另一段男性语音的 voice timbre,为人物生成新的对白及相应嘴型动作。

三类案例均通过本地 API 提交生成任务,并提供任务状态查询和结果下载方法。完整请求参数、H3-Context-IR Prompt 和复现代码可在 Hugging Face Model Card 中查看。

完整 2K 工作流

为了帮助开发者验证完整的 H3 生成流程,我们提供了一套 Full 2K Workflow,将本地部署的 H3-Base 与官方 H3-Context-IR、H3-Regenerate-2K API 组合使用,以复现通过 MiniMax API 直接生成的 2K 视频质量。

整个流程分为三个阶段:

首先,H3-Context-IR 对用户输入的文本、图像、视频和音频等多模态信息进行理解与扩展,生成供 H3-Base 和后续再生成阶段使用的完整 Prompt。

随后,本地部署的 H3-Base 根据扩展后的 Prompt 与输入条件,生成短边为 768 像素的音视频结果。

最后,H3-Regenerate-2K 将 H3-Base 生成的 768p 视频作为base_video,并结合扩展后的 Prompt 与原始输入上下文,再生成 2K 视频。

我们同样提供了三类完整复现案例:

  • T2VA:输入文本 Prompt,依次完成 H3-Context-IR 扩展、H3-Base 768p 生成与 H3-Regenerate-2K 再生成;

  • I2VA:输入文本与首帧图像,由 H3-Context-IR 生成扩展 Prompt,再通过 H3-Base 和 H3-Regenerate-2K 完成首帧图生视频;

  • Ref2VA:输入文本、参考视频与参考音频,完成多模态参考视频生成,并在 2K 再生成阶段继续使用原始参考素材与 H3-Base 输出。

对于每个案例,我们还提供了通过开放平台 API 直接生成的 2K 和 768p 参考结果,方便开发者对本地部署与完整工作流的输出进行验证。

在示例代码中,本地 H3-Base 输出会被编码为 Base64 Data URL 并传入 H3-Regenerate-2K;在生产环境中,我们建议将视频上传至可公开访问的 URL,并将该 URL 作为base_video传入。

完整的接口配置、请求参数、示例代码与参考结果,请前往 Hugging Face Model Card 查看。

许可协议

MiniMax H3 基于MiniMax H3 Community License发布。

如有疑问,请通过 model@minimax.io 与我们联系。

快速体验 MiniMax H3

H3-2K 直出:platform.minimaxi.com/docs/api-reference/video-generation-v2-create

H3-Context-IR:platform.minimaxi.com/docs/api-reference/video-generation-v2-h3-context-ir

H3-Regenerate-2K:platform.minimaxi.com/docs/api-reference/video-generation-v2-regeneration

MiniMax Hub: hub.minimaxi.com

海螺 AI:hailuoai.com

开源地址:huggingface.co/MiniMaxAI/MiniMax-H3

Intelligence with Everyone.

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
人形机器人IPO变天!宇树科技成科技股大笑话,监管层终于出手了

人形机器人IPO变天!宇树科技成科技股大笑话,监管层终于出手了

故事终将光明磊落
2026-09-09 21:22:52
爱发语音的女子突然发来大段文字,家人报警一周后等来其死亡的消息,案件细节披露:相识网友以拍摄写真为由,让其带上全部饰品外出后行凶

爱发语音的女子突然发来大段文字,家人报警一周后等来其死亡的消息,案件细节披露:相识网友以拍摄写真为由,让其带上全部饰品外出后行凶

扬子晚报
2026-09-10 07:58:29
再见17!iPhone18彻底补全所有短板,刚买17的人心态崩了

再见17!iPhone18彻底补全所有短板,刚买17的人心态崩了

小柱解说游戏
2026-09-09 02:05:46
联盟第二老!鹈鹕官宣裁掉与詹姆斯同龄吉布森 或退役结束17年生涯

联盟第二老!鹈鹕官宣裁掉与詹姆斯同龄吉布森 或退役结束17年生涯

醉卧浮生
2026-09-09 23:57:29
波多黎各主帅:中国太强不想再和她们对阵 能否把张子宇送给我们队?

波多黎各主帅:中国太强不想再和她们对阵 能否把张子宇送给我们队?

罗说NBA
2026-09-10 07:03:11
无缘首进美网四强!郑钦文1-2终结7连胜 莱巴金娜首登世界第一

无缘首进美网四强!郑钦文1-2终结7连胜 莱巴金娜首登世界第一

醉卧浮生
2026-09-10 01:57:47
往长江倒黑泥后续!央视出手,真相终于大白,始作俑者要被重罚

往长江倒黑泥后续!央视出手,真相终于大白,始作俑者要被重罚

兵卒史
2026-09-09 17:37:28
“长沙摸臀案”舆论升级!知名作家陈岚称,如果发生在美国,遇到的处理方式是以保护未成年人的角度出发的

“长沙摸臀案”舆论升级!知名作家陈岚称,如果发生在美国,遇到的处理方式是以保护未成年人的角度出发的

火山詩话
2026-09-09 07:30:38
疯狂进球大战:总共轰入9球,阿隆索神换人,切尔西奇迹逆袭,1亿巨星梅开二度

疯狂进球大战:总共轰入9球,阿隆索神换人,切尔西奇迹逆袭,1亿巨星梅开二度

足球狗说
2026-09-10 06:15:54
年薪增至1900万,是美国总统7倍:全球最高薪领导人,为何还大幅加薪?

年薪增至1900万,是美国总统7倍:全球最高薪领导人,为何还大幅加薪?

40度观察
2026-09-09 17:17:33
转让二手电脑遇到“仅退款”套路,卖家从浙江打顺风车直奔800公里外讨说法;警方已刑事立案,已抓获3名犯罪嫌疑人

转让二手电脑遇到“仅退款”套路,卖家从浙江打顺风车直奔800公里外讨说法;警方已刑事立案,已抓获3名犯罪嫌疑人

都市快报橙柿互动
2026-09-10 01:16:03
真离谱!曝员工被禁止上厕所后裸奔抹屎,宁德时代辟谣并报警,公司群聊曝光,真相浮出水面!

真离谱!曝员工被禁止上厕所后裸奔抹屎,宁德时代辟谣并报警,公司群聊曝光,真相浮出水面!

谭谈社会
2026-09-09 23:27:16
欧冠上演英超西甲焦点大战:6.8亿豪门1-2被逆转 惨遭死敌5连斩

欧冠上演英超西甲焦点大战:6.8亿豪门1-2被逆转 惨遭死敌5连斩

狍子歪解体坛
2026-09-10 04:57:39
1-2被逆转!郑钦文输球原因曝光,3项数据拉胯,后续参赛计划敲定

1-2被逆转!郑钦文输球原因曝光,3项数据拉胯,后续参赛计划敲定

侃球熊弟
2026-09-10 02:08:46
女篮世界杯:中国险胜波多黎各晋级八强 韩旭21+11杨舒予15+11

女篮世界杯:中国险胜波多黎各晋级八强 韩旭21+11杨舒予15+11

颜小白的篮球梦
2026-09-10 01:32:56
知名刑辩律师朱明勇:远洋捕捞逐利性执法历朝历代都是要杀头的,南通公安局长高山就是被我告进去的

知名刑辩律师朱明勇:远洋捕捞逐利性执法历朝历代都是要杀头的,南通公安局长高山就是被我告进去的

追月数星
2026-09-09 20:08:26
一场2-3!输球不可怕,更可怕的是赛后蒯曼这番话:让人很揪心

一场2-3!输球不可怕,更可怕的是赛后蒯曼这番话:让人很揪心

江启
2026-09-10 00:01:07
中国女篮3分险胜晋级八强!赛后韩旭竟然这样说,老天在考验我!

中国女篮3分险胜晋级八强!赛后韩旭竟然这样说,老天在考验我!

田先生篮球
2026-09-10 03:51:59
9月9日俄乌最新:150平方公里,俄媒先崩了

9月9日俄乌最新:150平方公里,俄媒先崩了

西楼饮月
2026-09-09 22:26:48
董建华后代现状:长子经营家族企业,长女嫁美国人,幼子最有出息

董建华后代现状:长子经营家族企业,长女嫁美国人,幼子最有出息

青梅侃史啊
2026-09-09 16:44:40
2026-09-10 09:36:49
赛博禅心
赛博禅心
拜AI古佛,修赛博禅心
552文章数 58关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

iPhone18 Pro系列价格公布:A20 Pro芯片 续航大幅提升

头条要闻

iPhone18 Pro系列价格公布:A20 Pro芯片 续航大幅提升

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲被处罚2天,身边人传出好消息

财经要闻

银行新高!新一轮周期,刚开始!

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

艺术
亲子
游戏
本地
公开课

艺术要闻

禁止出境国宝!唐代孙位唯一存世真迹,宋徽宗亲笔题名

亲子要闻

媳妇说以后她来管钱,每个月给我200零花钱,还得戒烟戒酒才行

《星际火狐》免费更新支持四人组队参加联网战斗

本地新闻

宁波,中国制造的隐藏大佬

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版