Google提出AudioPaLM:一个可以说话和听的大型语言模型。
页面:http://t.cn/A6pTC3cR
论文:http://t.cn/A6pTC3cQ
我们介绍了AudioPaLM,这是一个用于语音理解和生成的大型语言模型。AudioPaLM将基于文本的和基于语音的语言模型,PaLM-2 [Anil等人,2023]和AudioLM [Borsos等人,2022],融合到一个统一的多模态架构中,该架构可以处理和生成文本和语音,应用包括语音识别和语音到语音的翻译。
AudioPaLM继承了从AudioLM保留副语言信息(如说话者身份和语调)的能力,以及仅在大型语言模型(如PaLM-2)中存在的语言知识。我们证明,用仅文本的大型语言模型的权重初始化AudioPaLM可以改善语音处理,成功地利用预训练中使用的大量文本训练数据来协助语音任务。
结果模型在语音翻译任务上显著优于现有系统,并且具有对许多在训练中未见过输入/目标语言组合的语言进行零样本语音到文本翻译的能力。AudioPaLM还展示了音频语言模型的特性,例如基于短语音提示在语言之间转移声音。 http://t.cn/A6pTCBqG
发布于 美国
