Meta Superintelligence Labs 发布了一款名为 Muse Voice Transcribe 的实时音频感知模型,号称是业界首个此类产品。它最抓人的点在于,能一边听一边转写,不用等整段音频结束。
这模型在几个硬指标上挺能打:支持实时流式语音识别,能同时区分 20多个说话人,还自带判断谁该停、谁该接话的端点检测。多语言切换时也不用断流,中英混着说也能无缝跟上。
![]()
更聪明的是偏置功能。你可以通过设定语言、关键词或上下文,让模型在转写时"偏向"某些内容,比如人名、专业术语,准确率能明显提升。
![]()
在第三方评测机构 Artificial Analysis 的流式语音转文本和公开说话人分离基准上,Muse Voice Transcribe 目前都排在第一位。Meta 这次把实时音频理解的标杆又抬高了一截。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.