阿里 Qwen 发布 Qwen-Audio-3.1 五款语音模型,语音价格最高下调 95%

💡 灵机 AI 深度洞见与核心提炼
阿里 Qwen 团队发布 Qwen-Audio-3.1,包含五款覆盖语音识别(ASR)、语音合成(TTS)和实时交互的模型。ASR 改进多语言和方言识别并自动清理填充词,ASR-Next 支持多说话人识别、时间戳及情绪和环境声检测;TTS-Next 将语言模型与扩散方法结合,可一次性生成语音、音效和背景音频。同步降价:TTS 约 70%,Realtime 约 85%,ASR 最高 95%。
信源媒体:The Decoder:AI News(RSS)
访问出处网页 ↗