OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2306.12925

AudioPaLM:统一语音理解与生成的语言建模框架

 
  shade ·  2026-08-29 11:01:16 · 16 次点击  · 0 条评论  

AudioPaLM:一种能听会说的多模态大语言模型

基本信息

  • 论文编号: arXiv:2306.12925
  • 提交时间: 2023年6月22日
  • 类型: Technical report

作者

Paul K. Rubenstein, Chulayuth Asawaroengchai, Duc Dung Nguyen, Ankur Bapna, Zalán Borsos, Félix de Chaumont Quitry, Peter Chen, Dalia El Badawy, Wei Han, Eugene Kharitonov, Hannah Muckenhirn, Dirk Padfield, James Qin, Danny Rozenberg, Tara Sainath, Johan Schalkwyk, Matt Sharifi, Michelle Tadmor Ramanovich, Marco Tagliasacchi, Alexandru Tudor, Mihajlo Velimirović, Damien Vincent, Jiahui Yu, Yongqiang Wang, Vicky Zayats, Neil Zeghidour, Yu Zhang, Zhishuai Zhang, Lukas Zilka, Christian Frank 等 30 位作者。

摘要

本文提出了 AudioPaLM,一个用于语音理解与生成的大规模语言模型。AudioPaLM 将基于文本的语言模型 PaLM-2 和基于语音的语言模型 AudioLM 融合为一个统一的多模态架构,能够处理和生成文本与语音,应用场景包括语音识别和语音到语音翻译。

AudioPaLM 继承了 AudioLM 保留副语言信息(如说话人身份和语调)的能力,以及 PaLM-2 中仅存在于文本大语言模型中的语言知识。研究表明,使用纯文本大语言模型的权重来初始化 AudioPaLM 可以提升语音处理性能,有效利用了预训练中大量文本训练数据来辅助语音任务。

实验结果表明,该模型在语音翻译任务上显著优于现有系统,并具备零样本语音到文本翻译能力,可处理训练中未见过的输入/目标语言组合。此外,AudioPaLM 还展示了音频语言模型的独特功能,例如基于简短语音提示实现跨语言的声音迁移。

论文示例已公开发布。

主题/分类

  • 主要分类: Computation and Language (cs.CL)
  • 其他分类: Artificial Intelligence (cs.AI); Sound (cs.SD); Audio and Speech Processing (eess.AS); Machine Learning (stat.ML)
16 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 14 ms
Developed with Cursor