7月21日,阿里云正式发布语音合成大模型Qwen-Audio-3.0-TTS。该模型在细粒度标签控制、freestyle指令遵循、多语种与方言支持及复杂声学鲁棒性方面实现升级,提供面向实时交互的Flash版(首包延时约300ms)和面向高质量生成的Plus版。Qwen-Audio-3.0-TTS-Plus近日登顶全球第三方权威榜单Artificial Analysis,其预览版Fun-Realtime-TTS此前已获该榜冠军。