Samir Sadok, Simon Leglaive, Laurent Girin, Xavier Alameda-Pineda, Renaud Séguier
本文提出了一种多模态动态变分自编码器(Multimodal Dynamical VAE,MDVAE),应用于无监督的视听语音表示学习。该模型的潜在空间被结构化设计,以解耦语音模态之间共享的动态潜在因素与各模态特有的动态潜在因素。同时引入了一个静态潜在变量,用于编码视听语音序列中随时间保持不变的信息。
模型以无监督方式在视听情感语音数据集上进行两阶段训练。第一阶段,分别对每个模态独立学习向量量化变分自编码器(VQ-VAE),不进行时间建模。第二阶段,在VQ-VAE量化前的中间表示上学习MDVAE模型。静态与动态信息、模态特有与模态共享信息的解耦均发生在第二个训练阶段。
论文进行了大量实验来探究视听语音潜在因素在MDVAE潜在空间中的编码方式,包括视听语音操作、视听人脸图像去噪以及视听语音情感识别等任务。结果表明,MDVAE能够在其潜在空间中有效地融合音频和视觉信息。此外,学习得到的视听语音静态表示可用于少量标注数据下的情感识别,其准确率优于单模态基线和基于视听Transformer架构的最先进监督模型。