通义实验室正式发布 Qwen-Audio-3.0-TTS 实时语音合成模型,此次更新亮点颇多,还包含两个版本,且已全面开放,在权威榜单中斩获冠军。
此次 Qwen-Audio-3.0-TTS 的更新主要集中在更广的语言覆盖、更自然的指令控制、更精细的标签控制,以及在参考音频不清晰时的鲁棒性,提升了模型的综合性能。
发布的两个版本各有侧重,Flash 版本面向实时交互,首包延迟在 300ms 左右;Plus 版本面向高质量生成,在自然度和音色还原度上表现更佳。
目前,Qwen-Audio-3.0-TTS 已全面开放,意味着更多用户可以使用到这款具有诸多升级特性的实时语音合成模型。
该模型在全球第三方权威榜单 Artificial Analysis 中斩获冠军,这充分证明了其在语音合成领域的领先地位和卓越性能。
编辑观点:Qwen-Audio-3.0-TTS 的发布及优异表现,将推动语音合成行业发展,后续有望在更多场景落地,带来更好的语音交互体验。