Paul K. Rubenstein, Chulayuth Asawaroengchai, Duc Dung Nguyen, Ankur Bapna, Zalán Borsos, Félix de Chaumont Quitry, Peter Chen, Dalia El Badawy, Wei Han, Eugene Kharitonov, Hannah Muckenhirn, Dirk Padfield, James Qin, Danny Rozenberg, Tara Sainath, Johan Schalkwyk, Matt Sharifi, Michelle Tadmor Ramanovich, Marco Tagliasacchi, Alexandru Tudor, Mihajlo Velimirović, Damien Vincent, Jiahui Yu, Yongqiang Wang, Vicky Zayats, Neil Zeghidour, Yu Zhang, Zhishuai Zhang, Lukas Zilka, Christian Frank 等 30 位作者。
本文提出了 AudioPaLM,一个用于语音理解与生成的大规模语言模型。AudioPaLM 将基于文本的语言模型 PaLM-2 和基于语音的语言模型 AudioLM 融合为一个统一的多模态架构,能够处理和生成文本与语音,应用场景包括语音识别和语音到语音翻译。
AudioPaLM 继承了 AudioLM 保留副语言信息(如说话人身份和语调)的能力,以及 PaLM-2 中仅存在于文本大语言模型中的语言知识。研究表明,使用纯文本大语言模型的权重来初始化 AudioPaLM 可以提升语音处理性能,有效利用了预训练中大量文本训练数据来辅助语音任务。
实验结果表明,该模型在语音翻译任务上显著优于现有系统,并具备零样本语音到文本翻译能力,可处理训练中未见过的输入/目标语言组合。此外,AudioPaLM 还展示了音频语言模型的独特功能,例如基于简短语音提示实现跨语言的声音迁移。
论文示例已公开发布。