千问发布 Qwen-Audio-3.1 下调 Qwen-Audio 全线语音模型价格
今天,千问正式发布 Qwen-Audio-3.1 系列语音大模型。本次升级不仅对语音识别(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大核心模型进行了全面进化,更重磅推出了全新的音频创作模型 Qwen-Audio-3.1-TTS-Next 和音频理解模型 Qwen-Audio-3.1-ASR-Next。五款全新的语音模型同时推出,形成了一套覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低用户使用成本,Qwen-Audio 全线语音模型价格均下调,其中TTS降价约70%,Realtime降幅约85%,ASR降幅达95%。
千问这波操作,直接把AI音频赛道的“地板”给掀了。
今天Qwen-Audio-3.1系列正式发布,5款模型直接把语音识别、合成、实时交互、音频创作的能力给包圆了:ASR能认30种语言+16种方言,还能自动去语气词、标说话人;TTS新增创作模型,音色更自然;Realtime实时交互延迟压到160毫秒,几乎和真人对话没区别。
更狠的是价格:ASR降95%,Realtime降85%,TTS降70%。
原来跑不起的全量会议转录、长视频审核、有声书批量制作,现在直接可以放开跑;中小开发者不用再为成本发愁,智能硬件、实时客服、AI主播这些场景,一下子就从“概念”变成了“能落地赚钱的生意”。
这背后是阿里的清晰算盘:
- 用全栈能力打穿音频场景,从“卖模型”变成“卖整套解决方案”;
- 用极致性价比挤压竞争对手,把中小厂商的生存空间直接压缩;
- 用价格换规模,把AI语音从“高门槛技术”变成“普惠基础设施”。
对市场来说,这是一个明确的信号:
AI音频的爆发期,真的要来了。
接下来,谁能把这些能力落地到具体场景,谁能靠规模化摊薄成本,谁就能吃到这波红利。
但做交易,别把降价直接当成股价上涨的保证书。
AI赛道的竞争,从来都是“技术+成本+场景”的综合比拼。
价格战能抢市场,但最终能不能守住,还要看能不能把客户留住、能不能把收入做厚。
题材炒预期,落地看场景。
千问把门槛打下来了,接下来就看谁能接住这波红利。
