Masked Audio Generation using a Single Non-Autoregressive Transformer
Alon Ziv, Itai Gat, Gael Le Lan, Tal Remez, Felix Kreuk, Alexandre Défossez, Jade Copet, Gabriel Synnaeve, Yossi Adi
本文提出了 MAGNeT,一种直接对多流音频 token 进行操作的掩码生成式序列建模方法。与先前工作不同,MAGNeT 由一个单阶段、非自回归的 Transformer 组成。在训练阶段,模型预测从掩码调度器获得的掩码 token 片段;在推理阶段,通过多个解码步骤逐步构建输出序列。为了进一步提升生成音频的质量,本文引入了一种新颖的重打分方法,利用外部预训练模型对 MAGNeT 的预测进行重打分和排序,并将其用于后续的解码步骤。此外,本文还探索了 MAGNeT 的混合版本,融合了自回归模型和非自回归模型:前几秒以自回归方式生成,而序列的其余部分则并行解码。本文在文本到音乐生成和文本到音频生成任务上展示了 MAGNeT 的效率,并进行了广泛的实证评估,包括客观指标和人类研究。所提出的方法在性能上与评估的基线方法相当,同时速度显著更快(比自回归基线快7倍)。通过消融研究和分析,本文揭示了 MAGNeT 各组成部分的重要性,并指出了自回归与非自回归建模在延迟、吞吐量和生成质量之间的权衡。