Meta 发布实时音频模型 Muse Voice Transcribe,主打语音转写与说话人分离

💡 灵机 AI 深度洞见与核心提炼
Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,将音频切分为 80 毫秒块,通过强化学习为每个词动态调整等待时间,并内置说话人区分(可同时区分 20 人以上)和句界检测。
信源媒体:The Decoder:AI News(RSS)
访问出处网页 ↗