42号电波
26-07-20 17:16 微博认证:AI博主

千问今天发布了语音合成大模型 Qwen-Audio-3.0-TTS,两个版本:Flash 版首包延迟压到 300ms 级,Plus 版拿了 Artificial Analysis 全球冠军。

但这次真正有意思的不是跑分。是它给 TTS 加了一套新的控制面:在文本里嵌入 [gasp](抽气)、[giggles](笑场)、[angry](愤怒),模型会按标签表演对应的呼吸和情绪细节。也可以用自然语言直接描述——「你是一位年轻女性小学老师,正在课堂上耐心地给一年级学生复述拼音规则。语速很慢,每一个发音都示范一遍,语调上扬带笑意。」——模型照着演。

这跟之前的 TTS 有质的不同。以前的模型追求「念对」,现在的模型在追求「演对」。

另外三件事叠在一起看:16 种语言 Plus 版说话人相似度全胜,20 种方言做了强化训练防止「特色弱化」,Flash 版 300ms 以内。说明千问不是只做了一个会表演的模型,是把表演能力铺到了多语种、多方言和实时交互里。

48KHz 高清输出 7 月 24 日上线。能不能听出一句方言到底有多地道,到时候就知道了。[不愧是你]

#千问发布语音合成大模型##千问Qwen-Audio-3.0-TTS发布##千问#

发布于 上海