OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2305.03582v1

MAmmoTH:面向数学与多学科思维链训练的大语言模型方案

 
  monkey ·  2026-09-04 11:01:14 · 9 次点击  · 0 条评论  

A Multimodal Dynamical Variational Autoencoder for Audiovisual Speech Representation Learning

论文信息

作者

Samir Sadok, Simon Leglaive, Laurent Girin, Xavier Alameda-Pineda, Renaud Séguier

摘要

本文提出了一种多模态动态变分自编码器(Multimodal Dynamical VAE,MDVAE),应用于无监督的视听语音表示学习。该模型的潜在空间被结构化设计,以解耦语音模态之间共享的动态潜在因素与各模态特有的动态潜在因素。同时引入了一个静态潜在变量,用于编码视听语音序列中随时间保持不变的信息。

模型以无监督方式在视听情感语音数据集上进行两阶段训练。第一阶段,分别对每个模态独立学习向量量化变分自编码器(VQ-VAE),不进行时间建模。第二阶段,在VQ-VAE量化前的中间表示上学习MDVAE模型。静态与动态信息、模态特有与模态共享信息的解耦均发生在第二个训练阶段。

论文进行了大量实验来探究视听语音潜在因素在MDVAE潜在空间中的编码方式,包括视听语音操作、视听人脸图像去噪以及视听语音情感识别等任务。结果表明,MDVAE能够在其潜在空间中有效地融合音频和视觉信息。此外,学习得到的视听语音静态表示可用于少量标注数据下的情感识别,其准确率优于单模态基线和基于视听Transformer架构的最先进监督模型。

学科分类

  • 主要分类:Sound (cs.SD)
  • 相关分类:Machine Learning (cs.LG)、Multimedia (cs.MM)、Audio and Speech Processing (eess.AS)
9 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 10 ms
Developed with Cursor