网易首页 > 网易号 > 正文 申请入驻

刚刚,中国语音AI连拿多项全球第一!

0
分享至


新智元报道


地铁急刹,金属尖叫,广播响起「请乘客注意扶稳」,人群骚动、孩子哭声、对讲机杂音一层层涌上来···

你甚至能感觉到车厢在晃。

这不是电影原声带。整段声音是用一句 prompt,AI 一次性生成的。

再来听一首歌。先是一段清唱,没有伴奏,就是一个人对着麦克风干唱:

然后,AI 接手了。一句提示词——

一首温暖柔和的 City Pop 男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫

模型直接在这段清唱的基础上,补齐了编曲、和声、节奏和完整制作:

从一段干巴巴的清唱,到一首有呼吸感的完整歌曲。你能听出来这是 AI 做的吗?

说实话,我第一次听的时候也没分出来。

音频大模型,开始比「体系」了

过去两年,语音 AI 赛道非常热闹。

Suno 两天前刚发布了 v6 系列,OpenAI 的 GPT-Realtime-2 今年把实时语音推理能力拉到了 GPT-5 级别,Google 在 I/O 上把 Gemini Live 推到 70+ 语言的流式翻译。

但有一个现象值得注意:几乎所有玩家,都在比单项。

做语音合成的比谁说话更像真人,做语音识别的比谁听写更准,做音乐的比谁生成的歌更好听,做实时对话的比谁反应更快。

然而现实世界里的语音需求,从来不是一个孤立的点。

一条短视频的声音制作,需要角色配音、环境音效、背景音乐,可能还需要先把素材里的人声转成文字做理解。

Voice Agent 要跑起来,语音识别、语音生成、实时交互、推理、工具调用得同时在线。一个音乐创作者做一首歌,可能先有一段清唱,需要 AI 补上编曲、和声和制作。

这些场景对应的不是一个模型,而是「一组能力」。

这正是行业正在发生的一个结构性变化:当单点能力逐渐拉平,决定竞争力上限的,变成了谁能把理解、生成、交互和创作连成一套完整的体系。

9 月 15 日,阶跃星辰一口气放出了 StepAudio 3 系列五款模型:StepAudio 3 TTS(语音生成)、StepAudio 3 Gen(完整音频生成)、StepAudio 3 Realtime(实时语音交互)、StepAudio 3 ASR(语音识别)和 StepAudio 3 Music(音乐创作)。

五条产品线,覆盖「听、说、理解、交互、创作」全链路。这在国内音频大模型领域,是第一家以完整矩阵形态同时推出的。

它反映出阶跃对语音 AI 竞争走向的一个判断:单项能力竞赛的窗口期正在关闭,全栈体系化能力开始成为真正的壁垒。

不过话说回来,全栈的前提是每一条腿都得站得住。

这一点,第三方榜单先给了答案——三个全球第一

Artificial Analysis Conversational Dynamics 榜单,StepAudio 3 Realtime 以 98.9% 的综合得分,全球第一。

这个榜单测的是「对话节奏感」:什么时候该接话,什么时候该等你说完,用户突然插一句是想打断还是只在附和。这恰恰是实时语音里最像人也最难的部分——不是听懂和回答,而是知道该不该现在开口。


Artificial Analysis Speech Reasoning 榜单,StepAudio 3 Realtime 以 99.7% 的语音推理准确率,位列全球第一。

这张榜考的是模型能不能直接「听」懂音频并完成复杂推理任务,而不是先老老实实转成文字再去想。它是业内评估原生语音模型最权威的第三方基准之一。


Artificial Analysis 非流式语音识别准确性榜单,StepAudio 3ASRWER(词错误率)仅 1.7%,并列全球第一。

WER 这个指标很朴素:每转写 100 个词错几个。1.7% 意味着差不多 60 个词才错一个,已经接近专业速记员的水准。


榜单说完了。接下来的部分,我们不看分数,只看这些模型在真实场景里到底是什么表现。

像人一样交流

语音模型的基础能力正在快速成熟。

但「识别准确」「声音自然」「响应够快」这些单点指标,已经不足以构成完整体验。

真正拉开差距的,是模型能否接近真实人类交流的状态:听懂语境、自然表达,并在持续对话中完成理解、回应和行动。

StepAudio 3 TTS:从「声音自然」到「表达自然」

市面上大多数 TTS 模型已经能把声音做得很「像真人」了。

但仔细听会发现,它们像的是「播音员」。字正腔圆,完美得不像在说话,更像在「朗读」。

真实的人类交流不是这样的。是「呃」、是「就是那个」、是说到一半改口、是突然笑出来又赶紧收住。

来听一段 StepAudio 3 TTS 生成的语音:

「我最近就特别纠结,就是要不要换工作这个事。呃,现在这家吧,钱少,但是离家近嘛,走路十分钟。新的那个 offer 呢,给得多,多个,多个四千吧大概,但通勤单程要一个半小时。我妈说钱重要,我朋友说命重要,我就,唉,怎么说呢,天天睡前想这事,越想越睡不着。」

注意那些细节:「就特别纠结」里带着微妙的叹气,「多个,多个四千」的口语化重复完全自然,说到「命重要」时语气微微上扬,紧接着的「唉」里满是无奈。

这些不是预设的情绪标签,而是模型根据语义自主判断出来的表达方式。

再来一段:

「你不老说通勤无聊吗,我给你安利个播客,就,讲那种,呃,讲历史八卦的。主播俩人特逗,一集大概,嗯,一个小时吧,正好我来回路上听。我这两个月,就,就靠它撑着了。你搜那个名字我回头发你,反正免费的。」

这段语音里的「就,就靠它撑着了」,两个「就」之间有一个几乎无意识的停顿,完全是人在组织语言时的自然节奏。

目前行业里大部分 TTS 模型处理这类口语化表达时,要么直接忽略重复词,要么机械地念两遍,很难做到这种「不完美但真实」的语感还原。

从技术层面看,StepAudio 3 TTS 在音色基底、语调层次、节奏律动和气口停顿上全面贴合自然口语模式,并能还原笑声、迟疑、结巴、改口等副语言特征。

前代 StepAudio 2.5 TTS 已经在全球权威的 Artificial Analysis Speech Arena 拿下国产第一、全球前三。

StepAudio 3 TTS 在这个基底上再往前推了一步,把「音色像不像」转移到了「说话方式像不像」。

StepAudio 3 ASR:从「听清」到「听懂」

语音识别看起来已经很成熟了。但 AI「听清」和「听懂」之间,隔着一条鸿沟。

你说「骁龙8至尊版」,它给你转成「小龙八至尊版」。你说「张靓颖」,它给你写成「张亮影」。

问题的根源在于,传统 ASR 只依赖声学信息——它在意「听到了什么音」,而不是「说的是什么意思」。

StepAudio 3 ASR 的思路是把高精度声学建模和大语言模型的语境理解结合在一起。

识别语音时,模型不只做「音-字」对应,还会调用语言模型的知识和推理能力辅助判断:根据上下文,这个音更可能是哪个词?

这个方向并非阶跃独创,业内多家都在探索 ASR 与 LLM 的融合。

但 StepAudio 3 ASR 的覆盖面值得关注:方言、口音、中英混说、低声耳语、快语速连读、甚至唱歌和有背景音乐的场景都能处理。长音频支持也不是简单的「切片-转写-拼接」,而是端到端的完整理解,避免上下文断裂。

这直接关系到会议纪要、视频字幕、智能客服、车载交互、医疗记录等一系列场景的实际可用性。

比如,我们先用 StepAudio 3 Gen 出一段机场的背景音。

再拿去让 StepAudio 3 ASR 去听。这其实是拿 StepAudio 3 自己考自己。

Gen 这边,广播腔拿捏得很准:有那种通过航站楼喇叭传出来的压缩感和轻微失真,不是干干净净的棚里录音。

ASR 这边更见功夫,全程 40 秒的音频里,「MU 5127」「C17」「C31」「18 点 45 分」这些字母数字混排的信息一个没错。

机场广播的登机口和航班号恰恰是最容易听错的部分,C17 和 C31 又是在同一句话里对照出现,转错一个字乘客就跑错门了。


AI 生成的声音能被 AI 准确听回来,这本身就说明两端的质量都立得住。

当 ASR 从「转写工具」进化为「语音理解基础设施」,它的产业价值就完全不同了。

StepAudio 3 Realtime:从「能打断」到「边聊边想边做」

全双工、打断、低延迟——2026 年,这些已经是实时语音的桌面赌注。

真正拉开差距的,是另一个问题:模型在一场持续对话中,能不能同时处理理解、回应、推理和行动?

举个例子。

你跟一个 Voice Agent 说:「帮我查一下明天北京飞上海的航班,要下午的,最好是东航。」

一个只做了全双工和打断的模型,可能先转文字再调 API,中间一段尴尬的沉默。更糟的情况是,你开始追问时它还没查完,系统直接卡住。

StepAudio 3 Realtime 的做法是推理与语音生成并行,工具调用和长任务异步执行。不阻塞当前对话,任务完成后自然接回上下文。同时它能感知语气、情绪、副语言和环境声音,不只是听你「说了什么」,还在理解你「怎么说的」。

我们来个实测。

一分钟里,连着改了四次口——坐飞机、别太晚到、时间从周五晚放宽到周六上午、直达。

每一次都是掐在 AI 刚开口的当口打断的。

先说打断本身。从人出声到 AI 闭嘴,几乎是即时的,没有那种「再念完半句话」的尴尬尾巴。

更难得的是它停下来之后不重启话头,只确认变化的那一条,该跳过的废话跳过了。

过程中,我把直达说成了「直飞」,它依然能知道是「直达的高铁」,直接理解你的意思。

还有个细节:整段下来它一次都没有擅自去「预订」,规则守得很稳。

能打断不稀奇,被打断四次还没被说懵,这才是实时语音该有的样子。

今年被广泛认为是 Voice Agent 商业化元年,从客服到金融再到车载,语音智能体正在密集落地。

在这个节点上,「演示可用」和「商业可用」之间的距离,往往就差在实时场景下能不能真正做到「听、说、想、做」同时在线。

从「出片段」到交付「作品」:Gen + Music

说完「交流」,再来看「创作」。

StepAudio 3 系列的另外两款模型——Gen 和 Music,瞄准的是一个正在发生的产业转向:音频生成的目标,正在从「输出素材」变成「交付作品」。

StepAudio 3 Gen:一次性搭建完整声音场景

回到开头那段「地铁突发事件」的音频。

传统做法是什么?配音演员录广播、音效库翻地铁刹车声和人群嘈杂声,然后在 DAW 里一轨一轨铺好、对齐时间线、调混响、做混音。

一个有经验的声音设计师,少说几个小时。

StepAudio 3 Gen 把这些原本分散的环节统一到了一个模型里:用自然语言描述场景和剧情,一次生成人声、音效、环境音和背景音乐,并自动完成时序编排。

但在行业视角下,这款模型更值得关注的是「控制粒度」。

它支持对多个角色分别设定音色、说话方式、语气、情绪、方言口音,乃至笑声、喘息、停顿等副语言细节,还可以指定各声音元素出现的时间和顺序。

这意味着模型不只在「生成声音」,而是开始参与「声音设计」——有意图、有结构的声音编排。

看这个实测。

一段废弃 KTV 的复仇戏,最狠的不是那些音效,而是女人声音里的情绪弧线。

从一开始那种冷到骨头里的平静,到「我女儿在里头」时嗓子里不易察觉的一丝颤,再到最后隔着门说「囡囡,你能睡了」时终于卸下来的那口气。这条情绪线是连贯的、有层次的,不是在几个情绪标签之间硬跳。

男人那边也值得注意:他从油滑到慌张到尖叫的崩溃过程,声场位置一直在远处带混响,和女人的近场贴麦形成了清晰的空间对位。

一段音频里同时做到情绪递进和空间叙事,这已经不是「生成音效」的水平了。

这也说明了一件事: StepAudio 3 Gen 不只是能「生成声音」,它开始能「讲故事」了。

影视、动画、游戏、广播剧、有声书创作者来说,这类能力一旦成熟,意味着声音制作的门槛和周期可能发生量级变化。

StepAudio 3 Music:从「替你写歌」到「帮你做歌」

AI 音乐生成正处于一个有意思的拐点。

「一句话生成一首歌」这件事,行业已经做得越来越好了。

但一个现实问题是:真正的音乐创作,很少是从零开始的一次性抽卡。

创作者手里可能已经有一段歌词、一段清唱或一个粗糙的 Demo,需要的是 AI 接着往下走——帮我配个编曲、换个风格试试、把副歌的情绪再推上去一点。

StepAudio 3 Music 覆盖了歌词成歌、纯音乐生成和干声智能配乐三条路径,支持歌词、干声、哼唱、参考音频等多种已有素材输入,让模型在创作者的基础上继续生成和完善。

回到开头那首 City Pop 歌曲。它的 prompt 附带了从 Intro 到 Outro 的完整歌词结构,模型在这个框架下完成了旋律、编曲和人声生成,保持了跨段落的能量变化和表达连贯性。

再来听另一首中文现场感流行抒情歌:

这首歌的 prompt 极其细致:

G 小调,74 BPM,四四拍。模拟真实乐队单遍演奏,配器只有钢琴、木吉他、真实贝斯、毛刷鼓和小编制弦乐。不要前奏,直接从第一句歌词开始。主歌保持低声克制,复句第二次加入弦乐。女声必须像真实录音,使用自然动态、真实呼吸、自然颤音。

注意这个 prompt 的颗粒度。它不只是在描述「我想要什么风格的歌」,而是在做音乐制作层面的精细控制——

调式、BPM、配器编排、段落动态、人声质感、录音美学,全部通过自然语言直接指定。

能够响应这种级别的指令并输出结构完整的作品,这在当前的 AI 音乐生成领域可是一个不低的门槛。

更硬核的是「清唱配乐」:提供一段清唱,模型理解其中的旋律、节奏和情绪,自动补充和声、乐器和完整编曲,把一段 a cappella 变成一首完整的成品。

全栈体系意味着什么

Gen 和 Music 放在一起看,体现的是音频生成赛道的一个重要转向:竞争焦点正在从「生成质量」向「作品完整度 + 创作控制力」迁移。

而把全部五款模型放在一起看,一个更大的图景浮现出来。

TTS 让 AI 开口像真人,ASR 让 AI 听懂人话,Realtime 让两者在实时对话中协同运转,Gen 生成完整声音场景,Music 参与完整音乐创作。

五条能力线拼在一起,形成了一套覆盖「理解→生成→交互→创作」的完整音频能力栈。

对开发者和产业客户来说,这意味着不用再在多家之间拼接 TTS、ASR、实时语音和音乐生成,然后花大量精力做对接和兜底。

一套体系内的模型在能力边界和接口设计上天然更容易协同。

从行业竞争格局来看,阶跃这次五款模型同时推出,发出的信号是明确的:语音大模型的竞争正在从「单项冠军赛」进入「全栈体系赛」。

这不是说单项能力不重要了。恰恰相反,全栈体系的前提是每一个单项都要过硬。

但当单点能力逐渐拉平,能否形成体系化的覆盖和协同,将越来越决定谁能成为产业客户的长期选择。

音频大模型的战事远没有结束。但至少在这个九月,当 AI 生成的地铁场景已经有了电影级的声音层次,当 AI 作曲已经能响应「毛刷鼓、小编制弦乐、自然颤音」这种级别的制作指令——

声音这件事,AI确实开始「玩真的」了。

编辑:所罗门

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
女生称同济大学痛经请假需脱裤检查,校方:必要时会做妇科检查,判断是否处于经期及是否有其他妇科疾病,若痛经到无法下床可开1至2天假条

女生称同济大学痛经请假需脱裤检查,校方:必要时会做妇科检查,判断是否处于经期及是否有其他妇科疾病,若痛经到无法下床可开1至2天假条

三湘都市报
2026-09-17 17:58:44
“这种脸型,长大后真的会自卑!”家长晒女儿视频,评论区一片唏嘘!

“这种脸型,长大后真的会自卑!”家长晒女儿视频,评论区一片唏嘘!

林林先生
2026-09-03 14:15:28
膝盖虚惊一场:巴萨门神为何只休一场就够

膝盖虚惊一场:巴萨门神为何只休一场就够

绿茵狂热者
2026-09-18 00:07:42
南方医科大学一学生坠亡,与导师聊天记录曝光,家属最新发声:网传均为谣言!

南方医科大学一学生坠亡,与导师聊天记录曝光,家属最新发声:网传均为谣言!

上观新闻
2026-09-17 08:27:31
宋美龄晚年拒绝回忆过去,却反复念叨:如果我的姐姐庆龄还活着的话

宋美龄晚年拒绝回忆过去,却反复念叨:如果我的姐姐庆龄还活着的话

海佑讲史
2026-09-16 16:30:19
做好最坏准备!两线作战不够,中国需具备一起打赢3场战争的实力

做好最坏准备!两线作战不够,中国需具备一起打赢3场战争的实力

混沌录
2026-08-30 22:26:21
60岁大爷每月2次性生活,坚持多年后,体检结果让人意外

60岁大爷每月2次性生活,坚持多年后,体检结果让人意外

医学原创故事会
2026-08-06 20:26:05
密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

极目新闻
2026-09-17 00:37:11
仗打不动了,以色列媒体当着全球抛出荒诞提议,美国人看完目瞪口呆:让美国年轻人通过“参军还学生贷、信用卡”

仗打不动了,以色列媒体当着全球抛出荒诞提议,美国人看完目瞪口呆:让美国年轻人通过“参军还学生贷、信用卡”

扶苏聊历史
2026-09-12 17:30:26
A股:今天为什么能放量普涨?三个原因!明天要大级别行情了?

A股:今天为什么能放量普涨?三个原因!明天要大级别行情了?

风风顺
2026-09-17 04:00:08
范玮琪丈夫陈建州心梗手术后首露面,自曝长期睡眠不足

范玮琪丈夫陈建州心梗手术后首露面,自曝长期睡眠不足

东方不败然多多
2026-09-18 00:58:24
退守台湾后,蒋介石养了上百名国军高级将领:啥都给,就是不给权

退守台湾后,蒋介石养了上百名国军高级将领:啥都给,就是不给权

小嶯说故事
2026-09-11 14:51:12
汤家凤项立刚完败!梳理全网反对英语主科的理由,全都没有说服力

汤家凤项立刚完败!梳理全网反对英语主科的理由,全都没有说服力

读鬼笔记
2026-09-16 15:42:45
一辆不值钱的“奔驰E300L”,让学生家长被嘲笑:现实点吧,别心比天高

一辆不值钱的“奔驰E300L”,让学生家长被嘲笑:现实点吧,别心比天高

熙熙说教
2026-08-31 14:59:44
印度破纪录了,恒河水被洗到“拉丝”,首都或将不再适合人类居住

印度破纪录了,恒河水被洗到“拉丝”,首都或将不再适合人类居住

有牙的兔纸
2026-08-29 18:39:05
长城官宣“新皮肤”!续航超1000km

长城官宣“新皮肤”!续航超1000km

手机评测室
2026-09-15 11:59:39
平陆运河给千年古镇带来大量商机,米粉店老板:不少游客来尝鲜,生意增长了约3倍

平陆运河给千年古镇带来大量商机,米粉店老板:不少游客来尝鲜,生意增长了约3倍

极目新闻
2026-09-15 19:17:10
英语退出主科风波持续升级!汤家凤被怒批:秦桧、不配当民族英雄

英语退出主科风波持续升级!汤家凤被怒批:秦桧、不配当民族英雄

小徐讲八卦
2026-09-17 15:22:30
全球首个!一针1800万,打一针管一辈子

全球首个!一针1800万,打一针管一辈子

怪味历史连连看
2026-07-22 15:34:32
亲子鉴定的结果能有多毁三观?网友:要是编的,我都给你颁发一个最佳编剧奖

亲子鉴定的结果能有多毁三观?网友:要是编的,我都给你颁发一个最佳编剧奖

带你感受人间冷暖
2026-09-18 00:08:13
2026-09-18 01:35:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16209文章数 67073关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 打造家庭泛越野智能座舱

态度原创

时尚
房产
教育
游戏
军事航空

潮流之向,自有回响——浪潮音乐大赏特别企划

房产要闻

突发!三亚安居房出台新政!

教育要闻

都叫七中不是一所学校成都家长最容易认错的集团校一篇分清

索尼Project Canis掌机参数曝光 目标2027年底推出

军事要闻

韩国外长表态:尚未决定是否向霍尔木兹海峡派兵

无障碍浏览 进入关怀版