![]()
作者|林易
编辑|重点君
国产AI,这次又了一把。
因为它直接把暑期档最火的电影——诺兰《奥德赛》的预告片,给复刻出来了!
如何?是不是已经有大片预告的那个味道了?
而这个视频背后,正是MiniMax刚刚发布的新视频旗舰——H3
![]()
从功能上来看,H3几乎把当前AI视频创作中比较受关注的能力都塞了进去,包括支持文字、图片、音频和视频等多种输入,人物、动作、运镜、风格和音色也能混合参考。
生成之后,我们还可以继续替换元素、修改背景、增加特效、延长视频,或者沿着原有画面继续创作,最终输出清晰度可以达到2K
若是单看这些功能的升级,确实已经足够撑起一场旗舰模型发布。
但MiniMax这次还有一个更大的动作——宣布H3即将开源,在旗舰视频模型里,还是第一个这么做的!
那么问题来了:
一款最新的视频旗舰模型,怎么就敢在发布的时候这么做呢?
从一张白底图,拍到一部史诗片
正所谓真金不怕火来炼,如此之勇的MiniMax H3,且得好好实测一番来看下效果。
例如刚才我们复刻出来的《奥德赛》预告片的片段,就是用两张人物图和一张场景图,再配上下面这段Prompt生成的:
使用参考人物图A和B以及港口背景图,生成一个21:9、5-6秒的电影镜头。黑羽统帅站在画面中间偏左,背对镜头或半背对镜头,红冠战士站在右前方半侧身,两人站在海边军港前,身后是一艘巨大的古代长船和高高扬起的船首。海风轻轻吹动披风和头盔上的马鬃,背景士兵有轻微活动。镜头从中近景缓慢推近,整体气氛庄重、压抑、战前紧绷。人物脸要原创,不能像官方预告片演员。黑羽统帅低沉、克制、平静但有压力感地说“海还没给我们答案。但他们已经在等我们了。”
除了图片可以一口上传之外,像图片、视频、音频等多模态素材,都可以一次性交给H3来完成任务。
例如在下面的实测中,我们就把生成好的冰雪宫殿场景,以及一个背景为绿幕的小女孩视频传了上去:
![]()
![]()
在附上这样的Prompt:
把视频1中的绿幕背景,自然地替换成图片1 ,小女孩看到冰雪宫殿好奇且惊喜地说“哇!好漂亮啊!”
从最终效果来看,可以说是毫无违和感。
而如此操作方式也是体验了一把H3的商业价值,以后若是后期特效成本过于昂贵,演员仅需在绿幕前进行无实物表演,再将H3生成出来的场景“嵌”进去即可。
除此之外,目前在海外,尤其是X平台,已经有很多网友也开始对X进行了实测。
例如网友@Cia0_exe,便分享了他用6789 个字符的Prompt,生成出来的超炫酷的动漫风视频:
并且他还评价说H3要比Seedance 2的效果要好:
![]()
无独有偶,还有网友@darshal_拿着H3和Seedance 2.0,做了一波商业广告的实测对比:
从双方的表现来看,H3的效果明显比Seedance 2.0要更加逼真,也更贴近商业广告所需的表达能力。
对此,@darshal_表示:
“虽然Seedance 2.0令人印象深刻,但H3在文本稳定性与产品一致性方面表现出色,使其在现实世界的品牌内容创作中更具实用性。”
实力够硬才是开源的底气
根据我们的实测,H3最突出的长板,是生成之后的后期环节。
现在不少视频模型已经能把单条镜头做得足够漂亮,Seedance 2.0在画质、动作和运镜上也有成熟表现。但到了影视、广告等实际生产中,一条镜头很少能靠一次生成直接交付。角色要继续沿用,产品包装和画面文字可能临时调整,背景、光线、动作和镜头节奏也会反复修改。模型能否接住已有素材继续加工,直接决定它能不能进入真正的制作流程。
从前文的商业广告对比和网友实测来看,H3相较Seedance 2.0更明显的优势,集中在文本稳定性、产品一致性,以及围绕现有镜头继续编辑的能力上。对于品牌广告来说,产品外观、包装文字和构图一旦发生漂移,画面再精致也很难投入使用。H3所强调的后期能力,正好击中了这个环节。
具体来看,H3把多模态参考与精准编辑接到了一起。人物图可以锁定角色,场景图负责确定美术风格,参考视频提供动作和运镜,音频补充声线与节奏;镜头生成之后,还能继续完成背景替换、元素修改、视频改写、实拍加特效和内容续写。
![]()
这类编辑的难点远不只是把一个元素贴进画面。背景发生变化,人物身上的光线和阴影也要同步调整;替换产品时,需要重新处理尺寸、透视、遮挡和运动轨迹;镜头正在移动,新加入的内容还得跟随相机位置变化。H3强调对画面、动作、风格和空间关系的整体理解,目标就是在修改指定内容的同时,尽量守住角色、构图和镜头的连续性。
前面的绿幕替换实测,验证了它对人物、背景和环境光的重新融合;商业广告对比则进一步体现了它在产品一致性和文字稳定性上的优势。对于影视和广告团队而言,这种“生成之后还能继续做”的能力,比单次生成一条好看的镜头更接近真实生产需求。
而这套后期能力,正是MiniMax敢把H3直接开源的第一层底气。
除此之外,开源这件事,放到全球AI发展的进程来看,也是越发的重要。
例如就在前两天,黄仁勋注册X后发布的第一条内容,没有留给新品、芯片或者财报,而是转发了一封支持开放模型的行业联名信。他在其中提到,AI会由各个国家建设,也会被不同公司使用,行业需要前沿的闭源模型,同样也需要前沿的开放模型。
其实这件事放在当下的AI竞争中来看,风向已经很明显了。因为到了今天,开源正在成为企业基础设施、产业生态乃至全球AI竞争中的一项关键变量。
连一向被视作闭源路线代表的OpenAI,也开始提供可以运行在自有基础设施或私有云中的开放权重模型;英伟达、Meta等公司则持续加码开放模型、数据集和工具链。
因此,接下来更合适的比较维度,是开源模型与闭源模型各自形成的产品逻辑
闭源模型的优势在于交付完整。用户注册账号或者接入API,很快就能调用能力,模型升级、推理优化、安全策略和运维工作也由厂商统一处理。对于追求快速上线的团队来说,这套路径更加省事。
开源模型则把更多控制权交给使用者。企业可以将模型部署在本地服务器或者私有云中,围绕内部数据和业务流程进行适配,也能接入自己的芯片、推理框架和工具链。它的门槛更高,但在数据控制、深度定制和长期成本上提供了另一种选择。
最近发生的几件事,又把这场路线竞争推到了台前。Hugging Face CEO Clément Delangue在旧金山组织了一场支持开放权重AI的“mini-march”,直接把开放模型从技术社区议题带进了公共讨论。
就在7月30日,OpenAI又宣布将GPT-5.6 Luna的价格下调约80%,Terra下调20%,最高档的Sol则维持原价。OpenAI将降价归因于系统效率提升,Axios和Reuters同时提到,更便宜的中国开放权重模型,也在给OpenAI、Anthropic等闭源厂商带来价格压力。
这些变化说明,开源与闭源的竞争已经从模型榜单延伸到了价格、部署方式和开发者生态。闭源厂商依靠平台体验与统一服务吸引用户,开放模型则通过可部署、可修改以及更灵活的成本结构扩大影响力。
对企业而言,选择也变得更加具体:追求开箱即用和统一服务,可以使用闭源平台;需要私有部署、深度定制、硬件适配和长期成本控制,开放模型往往更有吸引力。
因此,开源的价值很难只用“免费”概括。它让模型能力进入更多硬件、云平台和行业流程,也让开发者、研究机构与企业客户能够共同完善部署工具、推理效率和应用生态。
到了AI视频行业,这种差异还会被素材安全和内部制作流程进一步放大。
目前,前沿视频模型大多通过产品平台或API提供。以谷歌的Veo等模型为例,普通创作者可以直接在平台里使用,无需考虑部署和算力,确实方便。但对于影视、广告、游戏和品牌内容公司的头部客户来说,模型能否生成,只是项目能不能启动的第一步;它能否安全地进入内部工作流,才会影响后续是否敢大规模使用。
这些行业里,很多素材在项目上线之前都不能对外流转。
一部尚未官宣的影视项目,可能涉及剧本、分镜、角色设定、概念图、场景设计、演员素材、音色和未完成的镜头;广告公司手里则会有尚未发布的产品外观、品牌视觉规范、代言人素材、客户策略和创意方案。游戏公司的角色模型、世界观设定和美术资产,同样属于核心资产。
把这些内容持续上传到外部平台,头部客户会关心数据存在哪里、保留多久、由谁能够访问,以及相关素材是否会进入后续训练。即便平台能够提供相应的安全承诺,企业想围绕自己的角色库、美术资产和制作标准深度改造模型,依旧存在不少限制。
所以,很多闭源视频工具目前更容易先进入创意草图、分镜预演、投放素材和低敏感内容环节。涉及核心剧本、未发布产品和完整美术资产时,客户往往会更加谨慎。他们需要的,是模型可以部署在自主掌握的环境中,素材流向足够清晰,同时还能围绕内部角色、画风和工作流程持续训练和调整。
放眼整个AI视频行业,开放权重模型原本就比较少见。即使部分厂商最终选择开放,通常也会与线上旗舰版本保持一段时间差;还有不少前沿视频模型,长期只通过产品平台或者API提供。
原因并不难理解。视频模型需要同时处理人物、动作、镜头、声音、风格、空间关系和物理规律,还要维持前后帧的一致性。将这样一套模型开放出来,涉及的不只有模型权重,还包括推理成本、部署工具、硬件适配和后续的性能优化。
在这样的行业背景下,H3选择上线数日内开源,少见之处也就更加明确。MiniMax几乎把视频旗舰常见的开放时间差压缩到了零,开发者拿到的正是刚刚发布的H3旗舰版本,无需等待后续产品迭代之后再获得开放版本。企业可以围绕自己的数据、角色、画风和工作流进行部署与微调,云厂商、推理平台和开发者也能继续做压缩、适配和性能优化。
对于长期以闭源平台服务为主的视频AI行业来说,它带来的变化,显然比市场上多一个免费入口更值得关注。
MiniMax如何把多模态做进生产流程
在聊完MiniMax为什么选择上线便即将开源后,若是我们再往技术细节深挖,它这次开放透露出来的,也是一套围绕复杂多模态任务重新设计的技术体系。
这套体系的设计起点,是把“任务”从分散在不同模态的专家模型中抽离出来,用统一的语言描述来表达。
任务一旦能被语言描述,所有模态、所有任务就都成了同一种输入,模型也就可以从按模态切分的专用模型,走向可泛化的通用模型,并随语言能力的 Scaling 一起 Scaling。
首先要解决的,是模型如何理解一项视频任务。
MiniMax将H3的核心表征方式称为Contextual Omni Representation。它不只要求Caption描述目标视频,还要说明上下文素材与目标视频之间的关系,甚至包括不同素材彼此之间如何配合。
比如,人物图负责角色设定,场景图确定美术风格,参考视频提供动作和运镜,音频补充语气与节奏。模型既要理解每份素材包含什么,也要判断它们在任务中分别承担什么作用。
为此,MiniMax专门定制了模型和全模态理解管线。官方披露,大部分原始素材处理时需要消耗约10万Token,经过管线提炼后,平均压缩到约4000 Token。这样既能保留关键信息,也能控制上下文长度。
效率上的另一项关键调整,是H3-VAE。
MiniMax重新设计了前代Tokenizer技术,提升了重建质量和可学习性,并带来4倍的序列长度收益。视觉Token减少后,训练和推理成本也随之下降,这成为H3支持原生2K输出的重要基础。
在模型主体上,MiniMax采用了H3-Omni Transformer,并将“架构服务于任务”作为设计原则。
引入多模态上下文后,序列长度方差扩大了约3倍,理解与生成部分的计算负载也出现明显差异。团队因此采用理解与生成异构的训练架构,分别优化不同工作负载下的硬件利用率,并兼顾样本内部和样本之间的负载均衡,最终将端到端训练吞吐提升了近30%。
H3的2K输出,则采用了In-context Regeneration
它没有额外叠加常见的专用超分模块,而是让H3基座模型基于已有低分辨率结果,在原有多模态上下文中重新生成高分辨率版本。
这样既能复用基座模型已有的生成能力,也能再次利用上下文信息,尽量还原小文字、纹理和局部细节,减少传统超分依靠“猜测”补全信息带来的偏差。
把这些技术放在一起看,H3的路线就比较清楚了。
Contextual Omni Representation负责组织不同模态,H3-VAE负责压缩视觉Token,H3-Omni Transformer平衡理解与生成,In-context Regeneration则承担2K输出和细节恢复。它们共同指向一个目标:让模型能够理解复杂素材关系,并围绕同一项任务继续生成、修改和重建。
这也和前面的产品能力形成了对应。H3能够混合参考人物、场景、动作和音色,并完成元素替换、背景修改、视频改写、续写和特效处理,背后依赖的正是对多模态上下文的统一理解。所以,如果用一个词概括 H3 的意义,它不是又一个视频生成模型,而是代表任务泛化方法的一次落地。
放在MiniMax自身的发展路径中,这种选择并不意外。
MiniMax是行业里少数长期同时投入文本、语音、音乐、图像和视频,并持续尝试把这些模态连接起来的公司之一。多模态对它来说,不只是增加几种输入方式,更接近一种理解任务和组织现实信息的方法。
H3则让这条路线进一步进入真实生产流程。
随着今天Seedance 2.5和MiniMax H3相继进入市场,视频模型竞争的落点也越来越清晰。画面是否惊艳依然重要,真实项目更关心角色和产品能否保持稳定、已有素材能否继续利用、修改成本是否足够低,以及模型能否接入原有工作流。
当多模态开始解决这些具体问题,它也就真正切入了生产力,并在市场上显现出越来越高的价值。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.