Meta 发布实时音频感知模型 Muse Voice Transcribe
💡 灵机 AI 深度洞见与核心提炼
Meta Superintelligence Labs 发布 Muse Voice Transcribe,称其为首个实时音频感知模型。模型支持实时流式 ASR、20+ 说话人的 diarization 和 endpointing,多语言且可无缝 code-switching,可通过语言、关键词和上下文偏置提升准确率。该模型在 Artificial Analysis 的流式语音转文本和公开 diarization 基准上排名第一。
信源媒体:X:AI at Meta (@AIatMeta)
访问出处网页 ↗