网易首页 > 网易号 > 正文 申请入驻

为了理解而生成:他们用合成数据教会模型「视频通话」

0
分享至



一、什么是 OmniVChat?

从音视频问答到原生音视频对话

现有的音视频交互的研究中,对 “交互” 的定义往往其实是对音视频内容的问答,比如对于一个流式视频,用户输入一个文本问题,然后模型选择合适的时机回答。这样的交互和日常用户和 AI 的交互范式(比如和 AI 打视频电话)差别很大。



在这篇文章中,我们把 OmniVChat(Omni Video Chat)定义为原生的音视频对话:模型直接、同时接收用户音频和视频,无需额外的文本问题、外部字幕或语音识别转写,从而保留语气、停顿、表情和镜头朝向等线索。比如,用户举着手机,一边拍一边问:“我左边会议室的门开着吗?”,问题藏在语音和画面里,模型需要结合两者理解用户的处境,再给出文本回复。



  • 作者单位:香港中文大学,Alibaba Token Hub,上海交通大学,上海创智学院,浙江大学
  • 论文标题:
  • OMNIVCHAT: SYNTHESIZING, BENCHMARKING, AND TRAINING FOR NATIVE AUDIO-VISUAL DIALOGUE
  • 论文链接 (arXiv):https://arxiv.org/abs/2609.21465
  • Hugging Face 数据集: https://huggingface.co/datasets/Harland/OmniVChat
  • GitHub 代码: https://github.com/HarlandZZC/OmniVChat
  • 第一作者:何昊林,香港中文大学 DSP LAB 博士;楚云霏,Alibaba Token Hub(ATH)算法科学家,Qwen-Omni 系列核心贡献者;陈琦,上海交通大学 X-LANCE LAB 博士
  • 通讯作者:徐进,Alibaba Token Hub(ATH)算法科学家,Qwen-Omni 系列项目负责人;孔秋强,香港中文大学助理教授

二、研究现状:

缺少的既是数据,也是评测标准

要研究这种能力,首先需要有用户真正面向模型提问的音视频数据,用于训练和评测。然而,用户用自己的设备与模型对话的录制数据仍然非常稀缺,难以覆盖不同环境和交互细节。特别是多轮的原生音视频对话数据,包含 AI 在前轮中对用户的回应,几乎无法找到。由于数据的稀缺性,现有的 Omni 模型的原生音视频对话能力其实有待提高,往往需要各种辅助模块(比如语音转文字)来辅助交互,但是语音转文字等等辅助模块,往往会带来额外的计算量和信息损失,拉低了交互体验的上限。

其次,一句好回复往往要同时顾及环境、物体和情绪,同一个意思又有多种表达,单靠关键词匹配难以可靠评判 AI 回复的质量。数据从哪里来、回复怎样算好,是待解决的两个问题。

三、为了理解而生成

音视频联合生成和 Agent 的进展,让我们认为「为了理解而生成」(generation for comprehension)成为了可行的路线:先明确要测试的能力,再合成对应对话,并依据实际音视频内容形成参考回复和评分标准。同一套标准既能用于评测,也能作为训练奖励。

由此,我们构建了数据引擎 OmniVChat-Studio、评测基准 OmniVChat-Bench 和强化学习奖励设计 OmniVChat-RL,把原生音视频对话的造数据、测能力和改进模型接在一起。



图 1:OmniVChat-Bench 一览。每张卡片取自一条合成对话里的用户画面。

四、OmniVChat-Studio:

单轮与多轮的原生音视频对话数据引擎

我们设计了 OmniVChat-Studio ,一个 Multi-Agent 的原生音视频对话数据引擎,输入是一份子类配置和文本语料(作为随机种子),输出是带参考回复和分层判分标准的单轮、多轮音视频对话。

在 OmniVChat-Studio 中,包含四个智能体分工协作。Director 负责场景构思、剧本与提示词、审核决策,以及参考回复和评分标准;Renderer 把通过审核的提示词及参考媒体渲染成音画同步的片段;Reviewer 观察实际音视频,写出内容描述和质量报告,并回答针对性的核验问题;Validator 则是确定性的规则校验器,检查结构化剧本或对话记录是否满足配置要求。

单轮对话数据的合成从采样开始。系统按配置抽取语言、场景、镜头方式、音画干扰等属性,并默认随机抽取三段文本语料。Director 据此构思故事,再细化用户要问什么、目标物体怎样出现在画面里、何时说话和等待,最后写成带时间线的结构化剧本。属性控制交互条件,语料拓展内容,两者共同增加同一子类中的样本多样性。

渲染之前,Validator 检查格式、时间线、语速和配置中的规则,Director 结合上下文处理违规报告,并进一步检查剧本是否真正测到了目标能力。通过审核后,Director 组织镜头、连续拍摄、音画同步等渲染要求,交给 Renderer 合成片段。

渲染之后,Reviewer 检查实际说了什么、画面出现了什么,以及切镜、肢体等质量问题。Director 对照这些证据判断是否可用;门是开是关等关键细节不清楚时,就发起定向问答核实。参考回复和评分标准在音视频被接受后形成,并以实际证据为依据。

多轮对话数据的合成需要同时维护跨轮依赖。系统先规划整段对话及媒体引用关系,再逐轮编写提示词,按需使用已通过审核的视频、音频或末帧。较早出现的物体、人物声音和场景状态因此可以成为后续轮次的依据;用户换地点或话题时,也能选择合适的历史参考。每轮的片段和回复进入历史,全部完成后再校验整段记录,必要的计划修复从受影响的轮次开始。

这套流程也为扩展能力留下了接口。新增子类时,可以围绕它的配置、特定提示词和规则定制 Flexible 模块,复用 Fixed 模块及整体审核流程。最终交付的是音视频、参考回复和 rubric 配套的数据实例,可分别服务于后面的评测与训练。



图 2:OmniVChat-Studio 框架,左为单轮子系统,右为多轮子系统。每个模块的配色对应负责它的智能体。

五、OmniVChat-Bench:

对原生音视频对话的判分方法

OmniVChat-Bench 用合成对话评测全模态模型的基础对话能力,共 2,800 条,其中单轮 2,550 条、多轮 250 条,覆盖 5 个能力大类下的 17 个子类、22 个场景域。五个大类分别为:

  • 对话状态与连接感知(DSLP):判断连接是否正常、用户是否说完,以及当前镜头朝向。用户只是在思考停顿时应等待,询问左右关系时要以用户和相机的实际位置为依据。
  • 多模态实体对齐(MEA):把语音中的指代与画面里的对象对应起来,识别多人同时说话时真正与模型交互的用户,并在多轮对话中找回先前出现的对象、跟上说话人的变化。
  • 模型自我认知(MSA):正确说明身份和能力边界。例如,面对「帮我把它搬过去」的请求,没有肢体的模型应说明物理限制,并在适用时提供可执行的替代方案。
  • 反幻觉(AH):让回复忠于音画证据。被问到的物体不在画面里时应指出缺失,用户把可见物体的颜色等事实说错时应纠正前提,避免顺着错误信息继续回答。
  • 情绪识别(ER):结合面部表情和声音识别情绪,使回复同时回应用户的情绪和请求。相同一句话,用焦虑或轻松的语气说出来,可能需要不同的回应方式。

每条数据都附有参考回复和分层评分标准(tiered rubric)。标准按层级组织,每层包含一条或多条标准,对于每一层的每个标准,只有它被打中,并且同时所有小于这一层的标准被打中,这个标准才会被计分。大语言模型充当判官,按语义逐条判断是否满足,再由确定性的计分规则汇总,因此允许不同措辞表达相同的正确意思,也能定位回复具体漏掉了什么。

多轮评测时,所有模型接收相同的历史片段和参考回复,只对最后一轮回复评分,便于比较相同上下文下的能力。



图 3:OmniVChat-Bench 总览,共 2,800 条合成数据。左:五个能力大类及其 17 个子类,环上的条长表示数据条数,角度跨度表示该层内的子类数量。右:250 条多轮数据的轮数与时长分布,按子类堆叠。

六、把评测标准直接变成奖励:

OmniVChat-RL

OmniVChat-RL 是面向原生音视频对话任务的强化学习奖励设计,联合优化回复的正确性、效率和风格。正确性直接沿用评测时的 rubric 计分方法,再加入效率、风格两项质量信号,以及仅用于训练的格式项,让「答得对、表达简洁、适合对话」一起影响模型更新。

训练数据 OmniVChat-Bench-Train 包含 5,600 条合成对话和独立的 560 条开发数据,每条对话及其 rubric 都由 Studio 合成。开发集用来选 checkpoint;2,800 条 OmniVChat-Bench 数据用于检验训练成效,与训练视频不重叠;我们还构造了真人录制的 OmniVChat-Bench-Human ,只用于评测真实交互泛化,不参与训练或选点。对训练中采样的回复 y,总奖励为:

R (y)=r (y)+0.5f (y)+0.1e (y)+0.5s (y)

其中,r (y) 是分层 rubric 得分,决定回答是否抓住了该条对话的关键要求;f (y) 检查回复非空且不包含思考标签。

效率项 e (y) 比较回答同一个问题的多条候选回复。先把各自的 rubric 得分除以回复长度,再在同组候选间做 min-max 归一化,最小值记为 0、最大值记为 1,中间值按比例计分。这样,同样答对时更简洁的回复会得到更高的效率奖励,也无需给所有问题规定统一的字数目标。

风格项 s (y) 对应训练 system prompt 中的表达要求,包括自然口语、简洁表达、区分角色扮演与真实事实等。这些要求和语法流畅性共同组成七条标准,全部满足才得 1,否则得 0。训练奖励与评测 Style 使用同一套判官和标准,Style 汇报成功判分回复中七条全部通过的比例。

基座是 Qwen3-Omni-30B-A3B-Instruct 的 Thinker,直接编码视频和音频并输出文本。训练采用 GSPO、 rank 64 LoRA,保持音频和视觉编码器冻结,共 1,000 步,每 20 步保存一次 checkpoint,最终按开发集的 Subcategory Mean 选择第 940 步,并用同一个 checkpoint 检验合成评测集与真人录制集上的效果。



图 4:OmniVChat-RL 的 1,000 步训练。上:各奖励项的未加权值、绝对回复效率和平均回复长度。下:每 20 步在开发集、OmniVChat-Bench 与 OmniVChat-Bench-Human 上的 rubric 得分;右图以 Bench 中文子集作语言匹配对照。

七、结论:合成训练能高度泛化到真实交互场景

最重要的结果是:仅使用合成对话进行强化学习,模型在真实交互中的回复质量也明显提升。同一个 checkpoint 在 OmniVChat-Bench 上由 0.465 提升到 0.652,在完全不参与训练和选点的 OmniVChat-Bench-Human 上由 0.402 提升到 0.632,真人集提高 0.230。提升并未局限在合成视频的分布内,而是迁移到了真人手持设备拍摄、具有自然环境与真实说话方式的输入中。

OmniVChat 由此给出了一条可扩展的技术路线:以生成覆盖稀缺场景,以审核保证证据可靠,以分层标准统一评测与奖励,再用真实录制数据做独立验证。合成数据并不意味着真实数据不再重要;真实数据仍是检验泛化、发现遗漏能力和校准生成分布的关键。但实验表明,在真人交互数据昂贵且难以大规模获得时,经过严格设计的合成数据已经能够有效训练面向现实世界的原生音视频对话模型,并为后续融合更多真实反馈、拓展复杂多轮场景提供坚实起点。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
托蒂:我做过很多蠢事,也很后悔当年对巴洛特利的做法

托蒂:我做过很多蠢事,也很后悔当年对巴洛特利的做法

懂球帝
2026-09-28 17:31:06
河南一技校101名毕业生入职北大,所涉专业系全国唯一,该校曾入职北大的毕业生:有和北大人才中心签约的,也有劳务派遣

河南一技校101名毕业生入职北大,所涉专业系全国唯一,该校曾入职北大的毕业生:有和北大人才中心签约的,也有劳务派遣

极目新闻
2026-09-27 19:00:11
农村大妈烧秸秆,抓去关了三天后,大妈死活不出来,所长急了

农村大妈烧秸秆,抓去关了三天后,大妈死活不出来,所长急了

三农雷哥
2026-09-28 18:03:45
今天,A股跌到3823,做好准备了,明天,周二可能这样走

今天,A股跌到3823,做好准备了,明天,周二可能这样走

明心
2026-09-28 15:04:52
胜诉五年一分未拿到!嗨乐影视向范冰冰、范丞丞讨债6700万

胜诉五年一分未拿到!嗨乐影视向范冰冰、范丞丞讨债6700万

界面新闻
2026-09-28 10:54:20
杨毅:中国篮球推倒重来?足球已经推到监狱了!郭振明以后晋升无望

杨毅:中国篮球推倒重来?足球已经推到监狱了!郭振明以后晋升无望

念洲
2026-09-28 11:39:19
阿玛尼大秀,袁泉脸垮又方,莫文蔚一脸褶,“大嫂”高叶西装抢镜

阿玛尼大秀,袁泉脸垮又方,莫文蔚一脸褶,“大嫂”高叶西装抢镜

娱圈办事处
2026-09-27 22:27:58
一个扳手卖1万元!13人威海小工厂闷声发大财,悄悄干到全球第一

一个扳手卖1万元!13人威海小工厂闷声发大财,悄悄干到全球第一

李砍柴
2026-09-27 19:36:15
任素汐站C位,郭京飞瘦脱相了,仨人跑丹东大孤山干嘛去了

任素汐站C位,郭京飞瘦脱相了,仨人跑丹东大孤山干嘛去了

西楼知趣杂谈
2026-09-28 15:49:45
张本智和变谦虚了:中国和日本选手实力都很强!今后一直会是竞争对手

张本智和变谦虚了:中国和日本选手实力都很强!今后一直会是竞争对手

念洲
2026-09-28 06:54:15
大家发现没?混双颁奖仪式上,最开心的不是冠军林诗栋和蒯曼

大家发现没?混双颁奖仪式上,最开心的不是冠军林诗栋和蒯曼

带你领略世界风采
2026-09-28 06:56:09
主张联俄抗中的专家叛变了!去俄罗斯待了7天,回来就换了说法

主张联俄抗中的专家叛变了!去俄罗斯待了7天,回来就换了说法

游文刀
2026-09-24 21:18:36
11.99万,疯狂啊...

11.99万,疯狂啊...

放毒
2026-09-28 18:23:05
晨起喝温水是错的?医生苦劝:不想住进医院,晨起喝水牢记5点

晨起喝温水是错的?医生苦劝:不想住进医院,晨起喝水牢记5点

健康之光
2026-07-30 20:15:03
这个社会怎么了?国家连年给退休人员涨养老金,还有人吐槽没必要

这个社会怎么了?国家连年给退休人员涨养老金,还有人吐槽没必要

老媹古装影视解说
2026-08-14 13:33:07
“零销售”却7次涨停!002909,一纸公告戳破炒作泡沫,开盘秒跌停

“零销售”却7次涨停!002909,一纸公告戳破炒作泡沫,开盘秒跌停

大众证券报
2026-09-28 11:43:23
国产没有添加剂的面粉,这7个牌子值得看看,揉面时闻得到麦香

国产没有添加剂的面粉,这7个牌子值得看看,揉面时闻得到麦香

房产衫哥
2026-09-13 19:53:42
里夫斯又怀念詹姆斯!今夏三次流露不舍,追梦点破三巨头分手真因

里夫斯又怀念詹姆斯!今夏三次流露不舍,追梦点破三巨头分手真因

锅子篮球
2026-09-28 21:17:41
“当官免费,百姓要钱”?针对湖北医护人员的话,我们到底在气什么?

“当官免费,百姓要钱”?针对湖北医护人员的话,我们到底在气什么?

李昕言温度空间
2026-09-28 07:26:02
泽连斯基擅自泄密!公然宣称“将朝鲜战俘交给韩国”,李在明怒斥并要求道歉!或对朝鲜半岛局势产生重大影响

泽连斯基擅自泄密!公然宣称“将朝鲜战俘交给韩国”,李在明怒斥并要求道歉!或对朝鲜半岛局势产生重大影响

每日经济新闻
2026-09-28 20:08:49
2026-09-28 21:36:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14097文章数 142740关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

湖北日报:中国篮球断崖式下滑 篮协主席在哪谁来负责

头条要闻

湖北日报:中国篮球断崖式下滑 篮协主席在哪谁来负责

体育要闻

114项指控成立,曼城已经完蛋了吗?

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

英伟达新增1500亿美元股票回购授权

汽车要闻

越野级的方盒子 北汽星钽5X 17万级还配华为乾崑智驾

态度原创

艺术
教育
时尚
旅游
军事航空

艺术要闻

纳塔莉的粉彩女性,融合了古典的宁静与现代的深情!

教育要闻

“49元买的非遗月饼,换来学生白眼”,女老师被气哭:你们都不懂感恩吗?

秋天连衣裙应该怎么穿才好看?搭配这四款外套,舒适高级又优雅

旅游要闻

香港破边洲国庆假期试行预约,官方发安全提醒!曾有游客坠亡

军事要闻

特朗普"放话":美和古巴将达成协议 美方不需动用军队

无障碍浏览 进入关怀版