小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1
💡 灵机 AI 深度洞见与核心提炼
小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率大幅下降的鸡尾酒会难题。模型采用端到端 LLM 架构,以目标说话人参考音频作为声纹提示,在多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR 模型,可拒识非目标说话人并支持思维链推理模式。代码开源于 GitHub 和 HuggingFace。
信源媒体:IT之家(RSS)
访问出处网页 ↗