OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2405.12031

VSTAR:结合视觉与语音线索的视频字幕理解与推理基准

 
  lamp ·  2026-08-24 11:01:19 · 2 次点击  · 0 条评论  

Neighborhood Attention Transformer with Progressive Channel Fusion for Speaker Verification

作者

  • Nian Li
  • Jianguo Wei

摘要

基于 Transformer 的说话人验证架构通常需要比 ECAPA-TDNN 更多的训练数据,因此近年来的相关工作普遍在 VoxCeleb1&2 联合数据集上训练。本文提出了一种基于自注意力的骨干网络,仅使用 VoxCeleb2 训练即可取得具有竞争力的结果。

该网络交替使用邻域注意力(Neighborhood Attention)和全局注意力(Global Attention)来捕获局部与全局特征,随后聚合不同层次的特征,最后执行注意力统计池化(Attentive Statistics Pooling)。此外,作者采用渐进式通道融合(Progressive Channel Fusion)策略,随着网络加深逐步扩展通道维度的感受野。

作者在 VoxCeleb2 上训练所提出的 PCF-NAT 模型,并在 VoxCeleb1 及 VoxSRC 验证集上进行评估。实验结果表明:
- 浅层 PCF-NAT 的 EER 和 minDCF 平均比同等规模的 ECAPA-TDNN 低 20% 以上;
- 深层 PCF-NAT 在 VoxCeleb1-O 上取得了低于 0.5% 的 EER。

分类

  • Sound (cs.SD)
  • Audio and Speech Processing (eess.AS)

其他信息

  • 论文页数:8 页,2 张图,3 张表
  • 代码与模型已公开:https://github.com/ChenNan1996/PCF-NAT
  • 提交时间:2024 年 5 月 20 日(v1);最后修订:2024 年 5 月 30 日(v2)
2 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 27 ms
Developed with Cursor