小互AI
25-10-29 10:51 微博认证:AI博主

卧槽

兄弟们 Soul发布的这个语音模型

很强

SoulX-Podcast实现了:

高真实度、长时段、多说话人、多语种(中英双语 + 多方言)播客式语音生成

具备方言与副语言(如笑声、叹气等)控制能力

可连续生成 90 分钟以上 的对话内容而不失稳定性

支持普通话、英语及多种中文方言多人多轮对话

还支持在零样本(zero-shot)条件下完成声音与语气的克隆与迁移

副语言控制(Paralinguistic Controls)

允许文本中显式标注副语言符号,如:

<|laughter|>, <|sigh|>, <|breathing|>, <|coughing|>

在生成语音中体现为自然的笑声、叹息声、呼吸声等。

其作用包括:
提升语音表达的真实感与感染力;
改善播客式语音的韵律变化与情绪丰富度;
支持情境化生成(如“幽默场景”“紧张对话”)。

详细介绍:http://t.cn/AXAZZ5Jb

发布于 安徽