面壁智能的VoxCPM-0.5B模型,是一个文本转语音的模型。
这个模型只有0.5B参数,本地跑,完全是没有问题的。
目前已经登上抱脸的第三名,甚至实时语音都没有问题。
模型特点:
1.上下文感知、富有表现力的语音生成 - VoxCPM 理解文本以推断和生成适当的韵律,提供具有卓越表现力和自然流畅的语音。它根据内容自发地调整说话风格,在 180 万小时的海量双语语料库上训练出高度合适的声音表达。
2.逼真的语音克隆 - VoxCPM 只需一个简短的参考音频剪辑,即可执行准确的零样本语音克隆,不仅捕捉说话者的音色,还捕捉口音、情感语气、节奏和节奏等细粒度特征,以创建忠实自然的复制品。
3.高效合成 - VoxCPM 支持在消费级 NVIDIA RTX 4090 GPU 上实时因子 (RTF) 低至 0.17 的流式合成,从而实现实时应用。
模型地址:huggingface.co/openbmb/VoxCPM-0.5B
发布于 江苏
