Meta 发布实时语音感知模型 Muse Voice Transcribe
💡 灵机 AI 深度洞见与核心提炼
Meta 推出 Muse Voice Transcribe,为 MSL 首个实时音频感知模型,今日开始推送,自适应延迟下最终转写词错率低至 3.1%。该模型以 80ms 分块处理音频,在单一流式模型内原生处理说话人分离和端点检测,可自行判断何时输出文字、说话人何时切换;通过 Meta Model API、Meta AI for Mac 和 Muse Code 提供。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗