AIGCLINK
26-09-23 16:41 微博认证:AI博主

阿里刚刚一口气发了五款语音模型:Qwen-Audio-3.1系列,并全线降价,ASR降95%、Realtime降85%、TTS降70%

同时覆盖理解、生成、创作、实时交互的完整链条。阿里这次直接打出了语音模型的三板斧:能力全栈化、价格断崖下探、语音被推到Agent/硬件入口位置

它这次的Realtime不是只会聊天,是全双工可打断、能识别情绪、能多语言切换,还能调用工具,这就会把语音从搜索式问答推向事务式对话

实时语音从“功能”变成“交互入口”,直接冲击客服、助手以及硬件,AI眼镜、办公Agent、硬件结合等无屏化任务场景或将迎来一波热潮

ASR:能转写30种语言+16种中文方言、原生转写润色(去语气词/重复、语义重组)、分角色转写(谁在什么时候说了什么,带时间戳,支持插话/重叠语音)、流式低延迟(首字约160毫秒)

ASR-Next:从“语音转文字”扩展到“理解整个音频”,能听出情绪、环境声、机械声,理解事件时间、进行音频问答

TTS:重点是同一音色跨语言/方言不变味,还能控制情绪和语速

TTS-Next:这个比较狠,从“配音”升级到“做完整音频作品”,一次生成人声、音效、环境音,多角色音色一致、全程不变声;48kHz输出

直接瞄准播客、有声书、影视、游戏、广告等场景

Realtime:全双工,可同时说和听,可打断、能共情、能无缝切换语言、对话中能调用Agent工具完成任务

Qwen-Audio-3.1-ASR:
http://t.cn/AXOgR8rZ
Qwen-Audio-3.1-TTS:
http://t.cn/AXOgR8rz
Qwen-Audio-3.1-TTS-Next:
http://t.cn/AXOgR8rw
Qwen-Audio-3.1-Realtime:
http://t.cn/AXOgR8rA
Qwen-Audio-3.1-ASR-Next API即将出

#阿里最新语音模型##Qwen-Audio-3.1##AI语音助手#

发布于 美国