Meta今天开始推送Muse Voice Transcribe,这是MSL(Meta自研语音模型系列)首个实时音频感知模型。在自适应延迟下,它的最终转写词错率低至3.1%。
80ms分块处理,原生搞定说话人分离
![]()
这个模型用80ms分块处理音频,在单一流式模型内部原生处理说话人分离和端点检测。也就是说,它能自己判断什么时候该输出文字、说话人什么时候切换,不需要额外模块配合。
三个入口可用
目前通过Meta Model API、Meta AI for Mac和Muse Code三个渠道提供。对做实时转写或语音交互的开发者来说,这个延迟和准确率组合值得直接上手试。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.