Meta在语音转写这条赛道上,又往前推了一步。9月1日,Meta旗下MSL团队发布了新的Muse Voice Transcribe模型,并同步开放了API接口。这个模型主打流式语音转文字(streaming speech-to-text),训练语料覆盖了70多种语言。
消息发布后,Meta创始人扎克伯格(@finkd)的账号也转发了相关动态。从官方口径看,这个模型已经在Meta桌面应用的听写功能里跑起来了,同时Muse Code的语音输入也接入了它。也就是说,这不是一个停留在论文里的模型,而是已经落地到实际产品中的能力。
![]()
流式转写,为什么值得关注
流式语音转写和传统的先录音再转写有本质区别。流式意味着音频还在输入的过程中,文字就已经在实时生成,延迟被压到极低。这对实时字幕、会议记录、语音助手这类场景来说,体验差距是决定性的——你不需要等一段话说完,再等系统慢慢吐字。
Meta这次把SOTA(state-of-the-art,当前最优水平)作为卖点直接写在发布说明里,说明团队对模型在流式任务上的表现有相当信心。而70多种语言的支持范围,也让这个模型的适用面比很多只覆盖主流语种的方案要宽不少。
零数据留存,API的差异化打法
这次开放API时,Meta特别强调了一个点:提供零数据留存(zero-data-retention)的服务层级。这意味着开发者调用API时,音频数据不会被Meta留存用于模型训练或其他用途。在语音数据敏感度越来越高的当下,这个设计对企业和开发者来说是一个明确的信任信号。
从产品布局来看,Meta显然不打算只把语音转写能力锁在自己的应用里。开放API意味着第三方开发者可以直接调用这套能力,无论是做实时字幕工具、语音笔记应用,还是给客服系统加语音转写模块,都省去了从零训练模型的成本。
桌面应用和Muse Code已经用上了
官方信息显示,Meta桌面应用的听写功能已经在使用Muse Voice Transcribe,Muse Code的语音输入同样接入了这个模型。这种先内部落地、再对外开放的节奏,某种程度上也是一种验证——模型在真实产品场景里跑通了,才敢把API放出来给外部开发者用。
对于开发者来说,现在就可以去Meta的模型API页面申请接入。零数据留存层级的设置,让那些对数据合规有严格要求的团队多了一个选择。语音转写这个赛道竞争一直很激烈,Meta带着70多种语言和流式能力入场,接下来就看开发者怎么用了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.