Meta在语音识别领域放了个大招。9月1日,这家公司正式推出Muse Voice Transcribe——它的首个实时音频感知模型。开发者通过Meta Model API就能调用,定价是每1000分钟音频3美元,折算下来每小时成本约0.18美元(约合人民币1.2元)。
这个价格放在实时转写市场里相当有竞争力。但更值得关注的是它的工作方式:模型把流式自动语音识别、说话人分离和端点检测整合进了同一个流程。用户说话的同时,系统就在同步输出文字,不用等整段录音结束再单独处理。
![]()
“流式”到底解决了什么问题?
传统语音转写是“录完再转”,用户得等整段音频结束才能拿到结果。Muse Voice Transcribe的做法是边说边转——模型一小段一小段持续输出文字,延迟大幅降低。这种特性让它在实时听写、会议记录、通话字幕这些场景里有了用武之地。
更硬核的是它的多说话人处理能力。在包含20余名说话者的录音中,模型能逐一分离不同发言者,还能识别说话是否结束,自动判断一段输入的边界。这意味着一个多人会议里,谁说了什么、说到哪里停了,系统都能实时理清。
70种语言覆盖,25种已通过验证
训练数据覆盖了70余种语言,其中25种在发布时完成了验证。模型支持超过1小时的音频,也允许句内或句间的自然语言切换。开发者还能通过语言、关键词和上下文偏置,定向提升特定术语或场景下的识别准确率。
实时响应和准确度往往是一对矛盾——响应越快,能参考的上下文越少,出错率就越高。Meta的解法是引入一个叫“自适应延迟”的动态决策机制。系统不会对所有词语采用固定的速度与准确度取舍,而是针对每个词单独判断:需要额外接收多少音频后再输出结果。
遇到容易识别的语音,系统会更快提交转写;碰到发音不清、术语密集或语境复杂的词,它会调用更多前后文信息再下结论。这种逐词动态调整的策略,试图在“快”和“准”之间找到平衡点。
Meta官方数据显示,截至2026年9月1日,Muse Voice Transcribe在Artificial Analysis的流式语音转文本排行榜上位列第1。这个排名能否持续,要看后续实际使用中的表现——但至少从定价和技术路径上看,Meta这次确实给实时语音转写市场带来了一个新变量。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.