OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2306.05284

MusicGen:基于文本条件控制的高质量音乐生成模型

 
  balcony ·  2026-08-04 11:01:19 · 7 次点击  · 0 条评论  

Simple and Controllable Music Generation

作者

Jade Copet, Felix Kreuk, Itai Gat, Tal Remez, David Kant, Gabriel Synnaeve, Yossi Adi, Alexandre Défossez

摘要

本文研究条件音乐生成任务,提出了 MusicGen——一种在多个压缩离散音乐表示(即 token)流上运行的单语言模型(LM)。与先前工作不同,MusicGen 由单阶段 Transformer LM 配合高效的 token 交错模式构成,无需级联多个模型(如分层模型或上采样模型)。实验表明,MusicGen 可以生成高质量的单声道和立体声样本,并支持以文本描述或旋律特征为条件,从而对生成输出实现更好的控制。作者进行了广泛的实证评估(包括自动评估和人工研究),证明所提方法在标准文本到音乐基准上优于所评估的基线模型。通过消融研究,揭示了 MusicGen 各组成部分的重要性。

主题/分类

  • 主要分类:Sound (cs.SD)
  • 相关分类:Artificial Intelligence (cs.AI); Machine Learning (cs.LG); Audio and Speech Processing (eess.AS)

其他信息

  • 发表于 NeurIPS 2023
  • 提交时间:2023年6月8日;最后修订:2024年1月30日(v3)
  • 代码、模型和音乐样本:https://github.com/facebookresearch/audiocraft
7 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 12 ms
Developed with Cursor