爱可可-爱生活
26-09-24 18:46 微博认证:AI博主 2025微博新锐新知博主

阿里推出的工业级语音合成系统 Qwen-Audio-3.1-TTS 表现扎实。模型采用 12.5Hz 低帧率分词器压低推理延迟,经五阶段渐进训练协同优化 LM 与 FM。控制上既支持自然语言指令调度角色、语速和情绪,又引入86个行内标签精细调控呼吸与笑声等细节。它覆盖16种语言与20处方言区,支持单次生成3分钟长音频,在噪声与混响环境下克隆依然稳定,现已登顶 Artificial Analysis TTS 榜首:fun-resource-shanghai.oss-cn-shanghai.aliyuncs.com /cuijiayan.cjy/tmp/exp/qwen_audio_3_tts_blog_review_260918/index.shtml

发布于 北京