Meta 新推出的实时语音翻译模型 Seamless,能保持原声的表情和风格。
它比较先进的地方在于能判断当前的上下文是否足够输出,如果还不足以判断语音的真实含义,会等待有足够输入后再输出。
号称在语音生成文本和语音翻译方面超越了 Whisper 和 AudioPalm 2。
Seamless 包含一系列的语音模型:
- SeamlessM4Tv2:一款基础的多语种模型
- SeamlessStreaming:提供实时翻译功能
- SeamlessExpressive:能在翻译过程中保留原声的表情和风格
- Seamless:将以上所有模型集成在一起
Github: github.com/facebookresearch/seamless_communication
网站/论文: http://t.cn/A6lhPWvv
HF: http://t.cn/A6lhPOss
#微博新知# http://t.cn/A6lhPWqh
发布于 美国
