Meta 今日开始推送 Muse Voice Transcribe,这是其 MSL 系列首个实时音频感知模型。在自适应延迟下,最终转写词错率低至 3.1%,这个数字直接对标了离线转写的精度水平。
80ms 分块处理,边听边写
![]()
模型以 80ms 分块处理音频,在单一流式模型内原生处理说话人分离和端点检测。这意味着它能自行判断何时输出文字、说话人何时切换,不需要额外的后处理模块来"补课"。
三个入口,即刻可用
目前该模型通过 Meta Model API、Meta AI for Mac 和 Muse Code 三个渠道提供。对开发者来说,API 接入意味着可以快速把实时转写能力塞进自己的应用里,省掉自己拼装流式管线的时间。
实时语音转写一直是工程难点,延迟和准确率往往难以兼得。Meta 这次把词错率压到 3.1%,同时保持流式输出,算是给这个老问题提供了一个新解法。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.