基于 Transformer 的说话人验证架构通常需要比 ECAPA-TDNN 更多的训练数据,因此近年来的相关工作普遍在 VoxCeleb1&2 联合数据集上训练。本文提出了一种基于自注意力的骨干网络,仅使用 VoxCeleb2 训练即可取得具有竞争力的结果。
该网络交替使用邻域注意力(Neighborhood Attention)和全局注意力(Global Attention)来捕获局部与全局特征,随后聚合不同层次的特征,最后执行注意力统计池化(Attentive Statistics Pooling)。此外,作者采用渐进式通道融合(Progressive Channel Fusion)策略,随着网络加深逐步扩展通道维度的感受野。
作者在 VoxCeleb2 上训练所提出的 PCF-NAT 模型,并在 VoxCeleb1 及 VoxSRC 验证集上进行评估。实验结果表明:
- 浅层 PCF-NAT 的 EER 和 minDCF 平均比同等规模的 ECAPA-TDNN 低 20% 以上;
- 深层 PCF-NAT 在 VoxCeleb1-O 上取得了低于 0.5% 的 EER。