7月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖及复杂声学鲁棒性等方面实现系统性提升。该模型包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,推动合成语音从“能说话”迈向“会表达”。
目前,在全球第三方榜单Artificial Analysis中,Qwen-Audio-3.0-TTS-Plus已登顶,其预览版Fun-Realtime-TTS也曾在一个月前占据榜首。
7月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖及复杂声学鲁棒性等方面实现系统性提升。该模型包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,推动合成语音从“能说话”迈向“会表达”。
目前,在全球第三方榜单Artificial Analysis中,Qwen-Audio-3.0-TTS-Plus已登顶,其预览版Fun-Realtime-TTS也曾在一个月前占据榜首。