网易首页 > 网易号 > 正文 申请入驻

淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作

0
分享至



TaoMate-H3 是由阿里巴巴 TaoLive AIGC 团队研发的音视频联合流式生成模型。基于 MiniMax H3,TaoMate-H3 将三步 LoRA 推理与自回归生成相结合,能够根据文本描述,连续生成包含人物对白、歌声或环境音的视频,支持分钟级续写,以及 480p、768p、1080p 级横竖屏输出。

与整段视频反复去噪的生成方式相比,TaoMate-H3 以小片段为单位推进,每个片段仅需三步去噪,无需等待整段视频完成生成。这一方式显著缩短了首段内容的产出时间,也为直播讲解、虚拟角色表演和交互式视频应用提供了新的技术基础。

目前,TaoMate-H3 推理代码与 LoRA 权重已正式开放。开发者可通过 GitHub 和 Hugging Face 下载体验,在此基础上开展应用开发与流式生成研究。以下是本次发布的演示效果。



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

  • 开源代码: github.com/TaoLiveAIGC/TaoMate-H3
  • 模型权重: huggingface.co/TaoLiveAIGC/TaoMate-H3

什么是 TaoMate-H3?

TaoMate-H3 面向需要持续生成声音与画面的创作场景。用户可以用一条提示词描述完整场景,也可以按段安排台词、动作和情节;模型在保留历史上下文的基础上继续生成,使相邻段落共享人物、声音和场景信息。

这次发布主要围绕三个核心能力展开。

  • 三步流式生成,降低等待时间

通过少步 LoRA,TaoMate-H3 将每个小片段的去噪过程压缩为三步。模型优先完成当前片段,再生成后续内容,无需等待整个视频完成去噪。对于需要及时反馈的内容生产,这种逐段产出方式有助于缩短等待,并为边生成边播放提供基础。

  • 音视频联合生成,丰富人物与场景表现

TaoMate-H3 在同一生成过程中处理声音与画面,既支持人物讲话、歌唱和角色对白,也支持海浪、车辆运动、爆炸等环境与动作音效。声音参与模型的生成过程,为口型、表情和动作提供时间上的配合。

  • 分钟级连续续写,支持分段内容编排

借助持续更新的音视频 KV 缓存和分段音频引导,模型能够跨越提示词边界延续前面的内容。创作者可以逐段调整讲解重点或表演内容,组织更完整的商品介绍和角色叙事。

应用效果

  • 电商讲解:从商品展示到完整介绍

商品介绍通常包含外观展示、功能细节和使用场景等多个环节。TaoMate-H3 支持用分段提示词编排这些内容,在连续镜头中推进讲解,适用于商品短视频、选品介绍和品牌内容制作。

本次展示包含一分钟的竖屏背包介绍,以及横屏木梳讲解。两组案例呈现了不同画幅下的人物口播与商品展示效果,其中背包视频保留了完整的一分钟生成结果。



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

背包讲解



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

木梳讲解

围绕同一件商品,创作者还可以针对不同人群调整讲解内容,例如突出通勤收纳、旅行携带或日常使用等需求。分段编排让卖点顺序与台词节奏更容易控制,也便于制作不同版本的商品内容。

  • 演唱与角色表演:声音、表情和动作共同呈现

除了商品口播,TaoMate-H3 还支持包含歌声与音乐的表演场景。窗边演唱案例展示了写实人物的歌唱过程,将旋律、口型和身体动作组织在同一段视频中。



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

窗边演唱

  • 动漫对白:拓展风格化角色创作

音视频联合生成同样适用于动漫内容。在月夜少女与白狐的案例中,风格化的人物、场景与角色对白共同构成了一个短剧情片段。创作者可以通过提示词设定角色形象、环境氛围与台词,再逐段推进故事情节。



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

月夜少女与白狐

  • 环境与特效:让场景拥有自己的声音

TaoMate-H3 的生成范围还包括没有人物对白的场景。日落海岸案例以海浪和环境原声表现空间氛围;电影爆炸案例则将人物运动、建筑爆炸与冲击音效结合起来,呈现更强烈的视听节奏。



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

日落海岸与海蚀拱门



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

人物向前,身后建筑爆炸

这些案例覆盖了商品讲解、人物演唱、动漫对白、风景与电影特效等不同内容类型。模型提供横竖画幅和多档分辨率,便于适配移动端内容与横屏展示。

TaoMate-H3 整体流程

从提示词到最终视频,TaoMate-H3 的推理流程主要包含四个环节:

  • 分段组织内容:根据目标时长读取提示词序列,确定每个段落的场景、动作和声音描述。
  • 准备音频引导:为当前段落生成音频去噪轨迹,并利用上一段尾部的声音信息衔接音色与语气。
  • 联合流式生成:将段落拆成小片段,每个片段执行三步音视频去噪,并持续更新历史 KV 缓存。
  • 解码输出:生成的 latent 通过 VAE 解码为画面与声音,完成媒体输出。公开推理入口会自动运行整套流程并保存最终视频。

其中,latent 是模型生成过程中使用的音视频压缩表示。模型先在这一表示空间中完成生成,再通过解码得到可观看、可收听的内容。

TaoMate-H3 关键技术

  • 三步 LoRA:减少每个片段的生成开销

TaoMate-H3 通过少步 LoRA 适配,将流式推理压缩到三个去噪区间。在当前五秒提示词配置下,每个段落分为四个 chunk,主体 chunk 约为 1.4 秒,尾部片段较短。模型依次完成这些片段,并利用历史上下文继续生成。

三步更新沿 0→16→33→49 的时间状态推进。每个片段完成后,模型基于最终生成的音视频状态更新 KV 缓存,供下一片段使用。少步生成减少了反复迭代的计算量,分块处理则使模型能够更早产出第一段内容。

Self Forcing:面向连续续写的自回归训练

在训练阶段,TaoMate-H3 采用 Self Forcing 的自回归训练思路,让模型以自身生成的历史片段为条件,继续生成后续内容。这使训练过程能够接触实际续写中的历史状态,缓解仅依赖真实历史训练所带来的训练与推理分布差异。



https://arxiv.org/pdf/2506.08009

这一训练方式与少步推理、KV 缓存共同构成了流式续写的基础:模型既学习当前片段的生成,也学习如何利用此前的输出延续人物、动作和场景。

  • 音视频 KV 缓存:支持长视频连续记忆

为维持长视频的一致性,TaoMate-H3 持续复用音视频 KV 缓存,将已生成内容的上下文传递给后续片段。人物状态、近期动作和声音信息因此能够随时间延续,在切换提示词时仍参与后续生成。

缓存采用「起始视觉参照 + 近期音视频上下文」的组织方式。起始参照保留人物与场景的初始信息,近期上下文随生成进度滚动更新,使模型能够跟随最新的动作与声音继续创作。

这种方式将历史缓存控制在固定规模内,避免其占用随视频时长不断增长,为分钟级连续生成提供了稳定的上下文支持。

  • 连续时间编码:改善跨提示词衔接

在长视频中,提示词可以变化,媒体时间线仍需连续。TaoMate-H3 使用全局连续的 RoPE 位置编码,随音视频进度移动当前文本的时间坐标,并将文本右边界对齐到当前媒体的起点,使新提示词对应正在生成的内容。

切换提示词时,系统保留已有音视频 KV,同时区分新生成内容与编解码所需的尾部上下文。历史内容仅用于衔接,不重复生成。针对长时间续写中的亮度和色调变化,模型还以首个片段的视觉统计为参照,对后续视频 latent 进行均值与方差对齐,减轻画面观感的漂移。

  • 音频轨迹引导:稳定台词节奏与音色

流式生成将视频拆成了短片段,但一句台词的停顿、语速和结束位置需要在完整段落内安排。TaoMate-H3 在内部先准备覆盖当前提示词段落的音频去噪轨迹,再将对应时间位置的音频 latent 用于引导各个小片段,使局部生成始终具有段落级的声音参照。

三次去噪更新分别对齐音频轨迹中的三个状态,最终音频 latent 与引导轨迹的干净终点保持一致。音频引导贯穿生成过程,有助于稳定台词的展开节奏,减少短片段续写时的重复起句。

为衔接不同段落的音色与语气,系统将上一段最后约一秒的干净音频作为只读参考。新音频在这一参考下继续生成,参考本身保持不变;最后统一解码各段音频 latent,得到连续的声音输出。

性能表现

在同一台 8 × NVIDIA H20 96 GB 机器上,我们对原版 MiniMax H3 与 TaoMate-H3 进行了测试,输出均为 480 × 864、十秒视频。

TaoMate-H3 的纯 DiT 计算耗时由 169.572 秒降至 14.810 秒,加速 11.45 倍;首段最终 latent 的就绪时间由 170.052 秒缩短至 6.148 秒,加速 27.66 倍。首段 latent 就绪对应模型完成第一段生成、可交给 VAE 解码的时间。



在上述十秒配置下,TaoMate-H3 共生成八个小片段,执行 24 次生成前向和 8 次 KV 更新。单机八卡采用 TP2 × Ulysses4 并行,并结合高效注意力、算子融合及部分线性层的选择性低精度计算,降低推理开销。

这些优化既提升了整段内容的生成效率,也缩短了首段内容的产出时间,为分块解码、播放和交互应用开发提供了基础。

快速体验

  • 环境与硬件

项目支持 Linux、Python 3.10/3.11、CUDA 12.8 与 PyTorch 2.8,提供单机 4 卡或 8 卡推理入口。已验证的运行配置为 8 × H20 96 GB,完整安装步骤见仓库 README。

  • 运行示例
  • 获取代码:git clone https://github.com/TaoLiveAIGC/TaoMate-H3.git cd TaoMate-H3

按照 README 完成环境安装和 MiniMax H3 基础权重下载后,即可运行仓库内的十秒示例。TaoMate-H3 LoRA 权重会在首次使用时自动下载:



结果保存在 outputs/demo_10s/video.mp4 。替换提示词文件即可修改场景、台词与动作;通过时长和分辨率参数,可以进一步生成更长的视频或切换横竖画幅。

  • 开源与后续计划

本次发布包含推理代码、LoRA 权重及示例提示词,欢迎开发者下载体验,也欢迎围绕流式推理、音视频生成和应用集成与我们交流。

项目基于 MiniMax H3,遵循 MiniMax H3 Community License。感谢 MiniMax H3 及相关开源工具的贡献者。

团队仍在持续优化推理速度,进一步缩短首段内容与后续响应的等待时间。我们也计划在不久的将来陆续发布并开源新的 FL2AV 流式模型,进一步拓展到 Ref2AV,并同步开放相应权重,支持更丰富的音视频创作方式。

期待与社区一起推进音视频流式生成,让这项技术走进更多实际的创作场景。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
资生堂千金李宓流产后晒比基尼照:5个孩子的妈

资生堂千金李宓流产后晒比基尼照:5个孩子的妈

大中国
2026-10-06 14:52:49
稻盛和夫:普通家庭最大的敌人不是穷,是一家人耗在一起互相拖垮

稻盛和夫:普通家庭最大的敌人不是穷,是一家人耗在一起互相拖垮

阿胖读书
2026-07-23 14:41:20
紫薇锁定No.1,德约三项使命,小钢炮轰中大姐,中国五虎战上海

紫薇锁定No.1,德约三项使命,小钢炮轰中大姐,中国五虎战上海

网球之家
2026-10-07 13:41:21
资治通鉴:没有家底、无人托举的普通人,一生只有一条正确的主线

资治通鉴:没有家底、无人托举的普通人,一生只有一条正确的主线

时尚的弄潮
2026-10-04 17:46:51
世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

世界首次500强差距断崖:日本149家,美国151家,中国3家,如今呢

福建睿平
2026-08-28 07:25:16
广东“神童”陈舒音,7岁上初中,12岁高考620分考入浙大,近况如何

广东“神童”陈舒音,7岁上初中,12岁高考620分考入浙大,近况如何

眼光决定境界
2026-10-07 06:07:35
真没想到!消失11年的李兆会,竟给44岁未婚的车晓留下一手好牌

真没想到!消失11年的李兆会,竟给44岁未婚的车晓留下一手好牌

离离言几许
2026-10-06 17:37:50
“性成瘾”是什么?患者自白:比烟瘾、酒瘾厉害多了,比戒毒还难

“性成瘾”是什么?患者自白:比烟瘾、酒瘾厉害多了,比戒毒还难

健康之光
2026-07-28 13:04:55
“还没当婆婆,就嫉恨起儿媳了!”中年家长为半个卤蛋发小作文

“还没当婆婆,就嫉恨起儿媳了!”中年家长为半个卤蛋发小作文

世界圈
2026-10-07 09:37:37
无人坦克在普京面前出大丑!俄罗斯疑暴发高致死性鼠疫

无人坦克在普京面前出大丑!俄罗斯疑暴发高致死性鼠疫

鹰眼Defence
2026-10-05 16:40:27
李湘携神秘中年男子现身韶山!55岁一头乌发气血十足,状态太绝了

李湘携神秘中年男子现身韶山!55岁一头乌发气血十足,状态太绝了

琴琴有氧运动
2026-10-06 00:15:45
我的性感,莫过于我的大长美腿

我的性感,莫过于我的大长美腿

疾跑的小蜗牛
2026-10-05 16:35:08
“同学妈妈把我儿子害成学渣”,家长使坏能有多离谱,长见识了

“同学妈妈把我儿子害成学渣”,家长使坏能有多离谱,长见识了

番外行
2026-10-06 19:15:24
日媒不解:明明国庆21.3亿人旅游,不来日本的中国人都去哪了?

日媒不解:明明国庆21.3亿人旅游,不来日本的中国人都去哪了?

浩舞纆画
2026-10-06 14:38:59
不想进国家队了?热刺中场M费给C罗声明点赞

不想进国家队了?热刺中场M费给C罗声明点赞

懂球帝
2026-10-07 14:25:09
滔搏ZUIAN面签未通过原因曝光!吃了有文化的亏

滔搏ZUIAN面签未通过原因曝光!吃了有文化的亏

游民星空
2026-10-06 19:10:12
原来刘欢晚年定居上海真相:不是搬家,是养病!北京才是他的根

原来刘欢晚年定居上海真相:不是搬家,是养病!北京才是他的根

娱圈办事处
2026-10-06 19:13:25
华为Mate 90首销数据出炉:京东Mate系列成交额达到去年同期8倍

华为Mate 90首销数据出炉:京东Mate系列成交额达到去年同期8倍

小8说科技
2026-10-07 14:57:15
网红食品翻车!多平台紧急下架!不适合给宝宝吃!

网红食品翻车!多平台紧急下架!不适合给宝宝吃!

天津族
2026-10-06 00:10:34
麻木的英国:美军所有B1轰炸机连夜撤走,它还在威胁以色列

麻木的英国:美军所有B1轰炸机连夜撤走,它还在威胁以色列

移光幻影
2026-10-06 17:45:15
2026-10-07 17:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14136文章数 142744关注度
往期回顾 全部

科技要闻

万亿砸向高速充电桩,排队为何仍是无解?

头条要闻

女生买3条总价不到80元"次抛衣"出国游 回程直接扔掉

头条要闻

女生买3条总价不到80元"次抛衣"出国游 回程直接扔掉

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

吴奇隆举旗活动取消,不赚钱也守立场

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

家居
房产
亲子
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

亲子要闻

产后如何提升性生活质量?康复科医生支招

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

外舰跟监遵义舰 结果自己先"趴窝"了

无障碍浏览 进入关怀版