爱可可-爱生活
25-09-08 20:54 微博认证:AI博主 2025微博新锐新知博主

IndexTTS2 发布:突破传统,自回归 TTS 实现精确时长与情感分离控制,助力影视配音及多场景高保真语音合成。

• 首次支持自回归模型中精准语音时长控制,可指定生成 token 数量,实现严格音画同步需求,适配视频配音等高精度场景。⏱️
• 情感表达与说话人音色彻底解耦,支持零样本条件下完美复现输入音频的情感特征,甚至可分别输入音色与情感音频,实现跨说话人情感迁移。
• 结合 GPT 潜在表示提升情感强烈语音的稳定性,避免失真,保证情感表达的清晰度与自然度。
• 创新文本驱动的软指令机制,基于 Qwen3 微调,通过自然语言描述精准调控情感倾向,降低使用门槛,扩展情感调节的灵活性与可控性。
• 多数据集实验验证优于现有零样本 TTS 模型,在词错误率、说话人相似度及情感还原度三项指标全面领先。
• 模型权重与推理代码即将开源,促进研究复现与产业应用,推动零样本情感语音合成技术普及。

了解更多🔗 index-tts.github.io/index-tts2.github.io/
GitHub🔗 github.com/index-tts/index-tts
#语音合成##零样本学习##情感计算##人工智能##多模态交互#

发布于 北京