网易首页 > 网易号 > 正文 申请入驻

为了理解而生成:他们用合成数据教会模型「视频通话」

0
分享至



一、什么是 OmniVChat?

从音视频问答到原生音视频对话

现有的音视频交互的研究中,对 “交互” 的定义往往其实是对音视频内容的问答,比如对于一个流式视频,用户输入一个文本问题,然后模型选择合适的时机回答。这样的交互和日常用户和 AI 的交互范式(比如和 AI 打视频电话)差别很大。



在这篇文章中,我们把 OmniVChat(Omni Video Chat)定义为原生的音视频对话:模型直接、同时接收用户音频和视频,无需额外的文本问题、外部字幕或语音识别转写,从而保留语气、停顿、表情和镜头朝向等线索。比如,用户举着手机,一边拍一边问:“我左边会议室的门开着吗?”,问题藏在语音和画面里,模型需要结合两者理解用户的处境,再给出文本回复。



  • 作者单位:香港中文大学,Alibaba Token Hub,上海交通大学,上海创智学院,浙江大学
  • 论文标题:
  • OMNIVCHAT: SYNTHESIZING, BENCHMARKING, AND TRAINING FOR NATIVE AUDIO-VISUAL DIALOGUE
  • 论文链接 (arXiv):https://arxiv.org/abs/2609.21465
  • Hugging Face 数据集: https://huggingface.co/datasets/Harland/OmniVChat
  • GitHub 代码: https://github.com/HarlandZZC/OmniVChat
  • 第一作者:何昊林,香港中文大学 DSP LAB 博士;楚云霏,Alibaba Token Hub(ATH)算法科学家,Qwen-Omni 系列核心贡献者;陈琦,上海交通大学 X-LANCE LAB 博士
  • 通讯作者:徐进,Alibaba Token Hub(ATH)算法科学家,Qwen-Omni 系列项目负责人;孔秋强,香港中文大学助理教授

二、研究现状:

缺少的既是数据,也是评测标准

要研究这种能力,首先需要有用户真正面向模型提问的音视频数据,用于训练和评测。然而,用户用自己的设备与模型对话的录制数据仍然非常稀缺,难以覆盖不同环境和交互细节。特别是多轮的原生音视频对话数据,包含 AI 在前轮中对用户的回应,几乎无法找到。由于数据的稀缺性,现有的 Omni 模型的原生音视频对话能力其实有待提高,往往需要各种辅助模块(比如语音转文字)来辅助交互,但是语音转文字等等辅助模块,往往会带来额外的计算量和信息损失,拉低了交互体验的上限。

其次,一句好回复往往要同时顾及环境、物体和情绪,同一个意思又有多种表达,单靠关键词匹配难以可靠评判 AI 回复的质量。数据从哪里来、回复怎样算好,是待解决的两个问题。

三、为了理解而生成

音视频联合生成和 Agent 的进展,让我们认为「为了理解而生成」(generation for comprehension)成为了可行的路线:先明确要测试的能力,再合成对应对话,并依据实际音视频内容形成参考回复和评分标准。同一套标准既能用于评测,也能作为训练奖励。

由此,我们构建了数据引擎 OmniVChat-Studio、评测基准 OmniVChat-Bench 和强化学习奖励设计 OmniVChat-RL,把原生音视频对话的造数据、测能力和改进模型接在一起。



图 1:OmniVChat-Bench 一览。每张卡片取自一条合成对话里的用户画面。

四、OmniVChat-Studio:

单轮与多轮的原生音视频对话数据引擎

我们设计了 OmniVChat-Studio ,一个 Multi-Agent 的原生音视频对话数据引擎,输入是一份子类配置和文本语料(作为随机种子),输出是带参考回复和分层判分标准的单轮、多轮音视频对话。

在 OmniVChat-Studio 中,包含四个智能体分工协作。Director 负责场景构思、剧本与提示词、审核决策,以及参考回复和评分标准;Renderer 把通过审核的提示词及参考媒体渲染成音画同步的片段;Reviewer 观察实际音视频,写出内容描述和质量报告,并回答针对性的核验问题;Validator 则是确定性的规则校验器,检查结构化剧本或对话记录是否满足配置要求。

单轮对话数据的合成从采样开始。系统按配置抽取语言、场景、镜头方式、音画干扰等属性,并默认随机抽取三段文本语料。Director 据此构思故事,再细化用户要问什么、目标物体怎样出现在画面里、何时说话和等待,最后写成带时间线的结构化剧本。属性控制交互条件,语料拓展内容,两者共同增加同一子类中的样本多样性。

渲染之前,Validator 检查格式、时间线、语速和配置中的规则,Director 结合上下文处理违规报告,并进一步检查剧本是否真正测到了目标能力。通过审核后,Director 组织镜头、连续拍摄、音画同步等渲染要求,交给 Renderer 合成片段。

渲染之后,Reviewer 检查实际说了什么、画面出现了什么,以及切镜、肢体等质量问题。Director 对照这些证据判断是否可用;门是开是关等关键细节不清楚时,就发起定向问答核实。参考回复和评分标准在音视频被接受后形成,并以实际证据为依据。

多轮对话数据的合成需要同时维护跨轮依赖。系统先规划整段对话及媒体引用关系,再逐轮编写提示词,按需使用已通过审核的视频、音频或末帧。较早出现的物体、人物声音和场景状态因此可以成为后续轮次的依据;用户换地点或话题时,也能选择合适的历史参考。每轮的片段和回复进入历史,全部完成后再校验整段记录,必要的计划修复从受影响的轮次开始。

这套流程也为扩展能力留下了接口。新增子类时,可以围绕它的配置、特定提示词和规则定制 Flexible 模块,复用 Fixed 模块及整体审核流程。最终交付的是音视频、参考回复和 rubric 配套的数据实例,可分别服务于后面的评测与训练。



图 2:OmniVChat-Studio 框架,左为单轮子系统,右为多轮子系统。每个模块的配色对应负责它的智能体。

五、OmniVChat-Bench:

对原生音视频对话的判分方法

OmniVChat-Bench 用合成对话评测全模态模型的基础对话能力,共 2,800 条,其中单轮 2,550 条、多轮 250 条,覆盖 5 个能力大类下的 17 个子类、22 个场景域。五个大类分别为:

  • 对话状态与连接感知(DSLP):判断连接是否正常、用户是否说完,以及当前镜头朝向。用户只是在思考停顿时应等待,询问左右关系时要以用户和相机的实际位置为依据。
  • 多模态实体对齐(MEA):把语音中的指代与画面里的对象对应起来,识别多人同时说话时真正与模型交互的用户,并在多轮对话中找回先前出现的对象、跟上说话人的变化。
  • 模型自我认知(MSA):正确说明身份和能力边界。例如,面对「帮我把它搬过去」的请求,没有肢体的模型应说明物理限制,并在适用时提供可执行的替代方案。
  • 反幻觉(AH):让回复忠于音画证据。被问到的物体不在画面里时应指出缺失,用户把可见物体的颜色等事实说错时应纠正前提,避免顺着错误信息继续回答。
  • 情绪识别(ER):结合面部表情和声音识别情绪,使回复同时回应用户的情绪和请求。相同一句话,用焦虑或轻松的语气说出来,可能需要不同的回应方式。

每条数据都附有参考回复和分层评分标准(tiered rubric)。标准按层级组织,每层包含一条或多条标准,对于每一层的每个标准,只有它被打中,并且同时所有小于这一层的标准被打中,这个标准才会被计分。大语言模型充当判官,按语义逐条判断是否满足,再由确定性的计分规则汇总,因此允许不同措辞表达相同的正确意思,也能定位回复具体漏掉了什么。

多轮评测时,所有模型接收相同的历史片段和参考回复,只对最后一轮回复评分,便于比较相同上下文下的能力。



图 3:OmniVChat-Bench 总览,共 2,800 条合成数据。左:五个能力大类及其 17 个子类,环上的条长表示数据条数,角度跨度表示该层内的子类数量。右:250 条多轮数据的轮数与时长分布,按子类堆叠。

六、把评测标准直接变成奖励:

OmniVChat-RL

OmniVChat-RL 是面向原生音视频对话任务的强化学习奖励设计,联合优化回复的正确性、效率和风格。正确性直接沿用评测时的 rubric 计分方法,再加入效率、风格两项质量信号,以及仅用于训练的格式项,让「答得对、表达简洁、适合对话」一起影响模型更新。

训练数据 OmniVChat-Bench-Train 包含 5,600 条合成对话和独立的 560 条开发数据,每条对话及其 rubric 都由 Studio 合成。开发集用来选 checkpoint;2,800 条 OmniVChat-Bench 数据用于检验训练成效,与训练视频不重叠;我们还构造了真人录制的 OmniVChat-Bench-Human ,只用于评测真实交互泛化,不参与训练或选点。对训练中采样的回复 y,总奖励为:

R (y)=r (y)+0.5f (y)+0.1e (y)+0.5s (y)

其中,r (y) 是分层 rubric 得分,决定回答是否抓住了该条对话的关键要求;f (y) 检查回复非空且不包含思考标签。

效率项 e (y) 比较回答同一个问题的多条候选回复。先把各自的 rubric 得分除以回复长度,再在同组候选间做 min-max 归一化,最小值记为 0、最大值记为 1,中间值按比例计分。这样,同样答对时更简洁的回复会得到更高的效率奖励,也无需给所有问题规定统一的字数目标。

风格项 s (y) 对应训练 system prompt 中的表达要求,包括自然口语、简洁表达、区分角色扮演与真实事实等。这些要求和语法流畅性共同组成七条标准,全部满足才得 1,否则得 0。训练奖励与评测 Style 使用同一套判官和标准,Style 汇报成功判分回复中七条全部通过的比例。

基座是 Qwen3-Omni-30B-A3B-Instruct 的 Thinker,直接编码视频和音频并输出文本。训练采用 GSPO、 rank 64 LoRA,保持音频和视觉编码器冻结,共 1,000 步,每 20 步保存一次 checkpoint,最终按开发集的 Subcategory Mean 选择第 940 步,并用同一个 checkpoint 检验合成评测集与真人录制集上的效果。



图 4:OmniVChat-RL 的 1,000 步训练。上:各奖励项的未加权值、绝对回复效率和平均回复长度。下:每 20 步在开发集、OmniVChat-Bench 与 OmniVChat-Bench-Human 上的 rubric 得分;右图以 Bench 中文子集作语言匹配对照。

七、结论:合成训练能高度泛化到真实交互场景

最重要的结果是:仅使用合成对话进行强化学习,模型在真实交互中的回复质量也明显提升。同一个 checkpoint 在 OmniVChat-Bench 上由 0.465 提升到 0.652,在完全不参与训练和选点的 OmniVChat-Bench-Human 上由 0.402 提升到 0.632,真人集提高 0.230。提升并未局限在合成视频的分布内,而是迁移到了真人手持设备拍摄、具有自然环境与真实说话方式的输入中。

OmniVChat 由此给出了一条可扩展的技术路线:以生成覆盖稀缺场景,以审核保证证据可靠,以分层标准统一评测与奖励,再用真实录制数据做独立验证。合成数据并不意味着真实数据不再重要;真实数据仍是检验泛化、发现遗漏能力和校准生成分布的关键。但实验表明,在真人交互数据昂贵且难以大规模获得时,经过严格设计的合成数据已经能够有效训练面向现实世界的原生音视频对话模型,并为后续融合更多真实反馈、拓展复杂多轮场景提供坚实起点。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
WTT法兰克福冠军赛名单公布 王楚钦、王曼昱在列

WTT法兰克福冠军赛名单公布 王楚钦、王曼昱在列

新华社
2026-09-28 20:25:29
3种豆子,已被列入肝病“黑名单”,再爱吃也不要碰了

3种豆子,已被列入肝病“黑名单”,再爱吃也不要碰了

路医生健康科普
2026-09-28 16:52:58
王楚钦总结亚运:唯一遗憾是男团决赛!林诗栋值得这枚男单金牌

王楚钦总结亚运:唯一遗憾是男团决赛!林诗栋值得这枚男单金牌

林小湜体育频道
2026-09-28 21:27:21
征信系统,为什么被越来越多人当成笑话?

征信系统,为什么被越来越多人当成笑话?

王二哥老搞笑
2026-09-27 03:15:22
东风导弹泄密案中,间谍郭万钧一家三口均被依法执行死刑

东风导弹泄密案中,间谍郭万钧一家三口均被依法执行死刑

人生录
2026-06-17 20:53:45
王曼昱三连胜张本美和又夺冠!张本智和看台翻白眼 双曼拥抱超有爱

王曼昱三连胜张本美和又夺冠!张本智和看台翻白眼 双曼拥抱超有爱

颜小白的篮球梦
2026-09-28 19:48:08
从确诊到去世仅15天,“央视最帅主持人”的遭遇为人们敲响警钟

从确诊到去世仅15天,“央视最帅主持人”的遭遇为人们敲响警钟

银河史记
2025-11-03 19:31:33
中国无耻文人胡兰成,玩弄了7名年轻女性后,最后却选择与50多岁的寡妇白头到老

中国无耻文人胡兰成,玩弄了7名年轻女性后,最后却选择与50多岁的寡妇白头到老

磊子讲史
2026-08-10 14:44:05
亚运会男子4x100米接力:中国队成功卫冕!中国台北、韩国分获银铜牌

亚运会男子4x100米接力:中国队成功卫冕!中国台北、韩国分获银铜牌

懂球帝
2026-09-28 21:47:07
上市一周,“神股”沈鼓逼近跌停后直线拉升翻红

上市一周,“神股”沈鼓逼近跌停后直线拉升翻红

中新经纬
2026-09-28 11:06:44
25岁女子吐槽河北婆婆做“糊弄饭”,老公不耐烦了:爱吃吃不吃滚

25岁女子吐槽河北婆婆做“糊弄饭”,老公不耐烦了:爱吃吃不吃滚

许三岁
2026-09-28 02:00:08
79年越南革命领袖黄文欢因亲华被判死刑,逃亡中国后的结局如何?

79年越南革命领袖黄文欢因亲华被判死刑,逃亡中国后的结局如何?

大运河时空
2026-09-27 15:50:05
中国5大通血管食物,洋葱排第5,第1名超市很常见,很多人不懂吃

中国5大通血管食物,洋葱排第5,第1名超市很常见,很多人不懂吃

医学科普汇
2026-08-01 21:25:06
SpaceX“星舰”发射升空,一台发动机提前关闭后仍决定尝试入轨

SpaceX“星舰”发射升空,一台发动机提前关闭后仍决定尝试入轨

界面新闻
2026-09-28 21:18:04
还打什么?41金中国拿30金,港台再拿3金,日韩抢8金抢到头破血流

还打什么?41金中国拿30金,港台再拿3金,日韩抢8金抢到头破血流

刘哥谈体育
2026-09-28 00:02:49
“拿筷子姿势恶心死了!”一段贫民窟小公主吃饭视频,给网友看力竭了!

“拿筷子姿势恶心死了!”一段贫民窟小公主吃饭视频,给网友看力竭了!

林林先生
2026-09-27 10:20:09
股价坐上过山车,华远控股股权“左手倒右手”,轻资产转型前路漫漫

股价坐上过山车,华远控股股权“左手倒右手”,轻资产转型前路漫漫

华夏时报
2026-09-28 09:13:04
棋后诸宸:嫁卡塔尔王室后放弃中国籍,接受一夫多妻,如今后悔吗

棋后诸宸:嫁卡塔尔王室后放弃中国籍,接受一夫多妻,如今后悔吗

文史达观
2025-06-03 18:58:40
如何看待两千多篇撤稿论文浪费国自然4780万版面费,经费还能被追回吗?

如何看待两千多篇撤稿论文浪费国自然4780万版面费,经费还能被追回吗?

本来就是个局外人
2026-09-28 15:09:35
日本标枪选手:严子怡很强,我想和她一较高下但赢的边都没摸到

日本标枪选手:严子怡很强,我想和她一较高下但赢的边都没摸到

懂球帝
2026-09-28 02:16:24
2026-09-28 22:24:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14097文章数 142740关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

湖北日报:中国篮球断崖式下滑 篮协主席在哪谁来负责

头条要闻

湖北日报:中国篮球断崖式下滑 篮协主席在哪谁来负责

体育要闻

114项指控成立,曼城已经完蛋了吗?

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

英伟达新增1500亿美元股票回购授权

汽车要闻

越野级的方盒子 北汽星钽5X 17万级还配华为乾崑智驾

态度原创

手机
时尚
数码
本地
健康

手机要闻

小米14、14 Pro电池升级服务10月1日上线,日常价189元、首周8折

秋天连衣裙应该怎么穿才好看?搭配这四款外套,舒适高级又优雅

数码要闻

谷歌承诺部分Chromebook笔记本将获Googlebook OS系统更新,细节暂未公开

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

这些食物,可能正在偷偷养痘!

无障碍浏览 进入关怀版