🎧五模齐发!能听懂、能创作、能聊天
今天,我们正式发布 Qwen-Audio-3.1 系列语音大模型。本次升级覆盖语音识别(ASR)、语音合成(TTS)与实时语音交互(Realtime)三大核心模型,并全新推出音频创作模型 TTS-Next 与音频理解模型 ASR-Next。五款模型同时推出,形成一套覆盖“理解—生成—交互—创作”的完整音频能力栈。
👂 Qwen-Audio-3.1-ASR:更强的上下文理解与润色
模型支持30种语言和16种中文方言,首字响应约160毫秒,边说边转写。它新增原生转写润色能力,自动去除语气词与重复表达、重组语义,让转写文字更顺畅、更有逻辑。
🎭 Qwen-Audio-3.1-ASR-Next:分清谁在说,更好地理解人物情绪与场景
它把处理对象从“语音中的文字”扩展为“完整的音频信息”,支持分角色语音识别,将说话人、时间戳与转写文本对应呈现;同时理解人物情绪、环境声与机械声,完成声音描述、事件定位、音频问答与推理。
🎵 Qwen-Audio-3.1-TTS:更自然的跨语言音色迁移
模型支持多语种与方言合成,同一音色在跨语言时也能自然迁移,让你秒讲数种语言。相比只求字音正确的传统方式,它更强调真实表达,可通过指令控制情绪、语速与表达方式。
🎬 Qwen-Audio-3.1-TTS-Next:更高效的音频创作方式
它不再局限于单一语音合成,而是围绕文本、时间戳与参考音频等输入,统一生成人声、音效与环境音。它处理的不再只是一段“要读出来的文字”,而是一段包含角色、情绪、场景与空间关系的全声景作品。
🗣️Qwen-Audio-3.1-Realtime:更会接话,更懂情绪
模型实现全双工实时交互,能同时说和听,用户可随时插话、打断,交流体验更接近真人通话。它理解的不只是语音中的文字,还有声音背后的情绪与意图,并能在对话中调用工具,连接 API、知识库与业务系统完成任务。
Qwen-Audio-3.1 系列模型 API 已上架千问 AI 平台,欢迎大家体验和反馈。从听懂一段声音,到生成完整声景,再到通过声音把事情办成,我们期待语音模型能够为大家带来更多惊喜!
#千问大模型##Qwen##AI##2026云栖大会#
