Jade Copet, Felix Kreuk, Itai Gat, Tal Remez, David Kant, Gabriel Synnaeve, Yossi Adi, Alexandre Défossez
本文研究条件音乐生成任务,提出了 MusicGen——一种在多个压缩离散音乐表示(即 token)流上运行的单语言模型(LM)。与先前工作不同,MusicGen 由单阶段 Transformer LM 配合高效的 token 交错模式构成,无需级联多个模型(如分层模型或上采样模型)。实验表明,MusicGen 可以生成高质量的单声道和立体声样本,并支持以文本描述或旋律特征为条件,从而对生成输出实现更好的控制。作者进行了广泛的实证评估(包括自动评估和人工研究),证明所提方法在标准文本到音乐基准上优于所评估的基线模型。通过消融研究,揭示了 MusicGen 各组成部分的重要性。