OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2401.04577

MAGNeT:基于非自回归掩码生成的高质量文本到音频模型

 
  available ·  2026-07-19 11:01:19 · 13 次点击  · 0 条评论  

使用单阶段非自回归Transformer进行掩码音频生成

标题

Masked Audio Generation using a Single Non-Autoregressive Transformer

作者

Alon Ziv, Itai Gat, Gael Le Lan, Tal Remez, Felix Kreuk, Alexandre Défossez, Jade Copet, Gabriel Synnaeve, Yossi Adi

摘要

本文提出了 MAGNeT,一种直接对多流音频 token 进行操作的掩码生成式序列建模方法。与先前工作不同,MAGNeT 由一个单阶段、非自回归的 Transformer 组成。在训练阶段,模型预测从掩码调度器获得的掩码 token 片段;在推理阶段,通过多个解码步骤逐步构建输出序列。为了进一步提升生成音频的质量,本文引入了一种新颖的重打分方法,利用外部预训练模型对 MAGNeT 的预测进行重打分和排序,并将其用于后续的解码步骤。此外,本文还探索了 MAGNeT 的混合版本,融合了自回归模型和非自回归模型:前几秒以自回归方式生成,而序列的其余部分则并行解码。本文在文本到音乐生成和文本到音频生成任务上展示了 MAGNeT 的效率,并进行了广泛的实证评估,包括客观指标和人类研究。所提出的方法在性能上与评估的基线方法相当,同时速度显著更快(比自回归基线快7倍)。通过消融研究和分析,本文揭示了 MAGNeT 各组成部分的重要性,并指出了自回归与非自回归建模在延迟、吞吐量和生成质量之间的权衡。

主题/分类

  • 主要学科:Sound (cs.SD)
  • 相关学科:Artificial Intelligence (cs.AI); Machine Learning (cs.LG); Audio and Speech Processing (eess.AS)

提交信息

  • 首次提交:2024年1月9日
  • 最新版本(v2):2024年3月5日
  • arXiv ID:2401.04577
13 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 12 ms
Developed with Cursor