卧槽
兄弟们 Soul发布的这个语音模型
很强
SoulX-Podcast实现了:
高真实度、长时段、多说话人、多语种(中英双语 + 多方言)播客式语音生成
具备方言与副语言(如笑声、叹气等)控制能力
可连续生成 90 分钟以上 的对话内容而不失稳定性
支持普通话、英语及多种中文方言多人多轮对话
还支持在零样本(zero-shot)条件下完成声音与语气的克隆与迁移
副语言控制(Paralinguistic Controls)
允许文本中显式标注副语言符号,如:
<|laughter|>, <|sigh|>, <|breathing|>, <|coughing|>
在生成语音中体现为自然的笑声、叹息声、呼吸声等。
其作用包括:
提升语音表达的真实感与感染力;
改善播客式语音的韵律变化与情绪丰富度;
支持情境化生成(如“幽默场景”“紧张对话”)。
详细介绍:http://t.cn/AXAZZ5Jb
发布于 安徽
