本文提出了 Treff 适配器(Treff adapter),一种针对 CLAP(Contrastive Language-Audio Pre-training)模型的训练高效适配器,旨在通过利用少量标注数据来提升零样本分类性能。具体而言,作者设计了 CALM 模块,用于从一组音频-标签对中检索文本-音频片段在各类别上的概率分布,并将其与 CLAP 的零样本分类结果相结合。此外,他们还通过将 CALM 作为余弦相似度度量,设计了一个免训练版本的 Treff 适配器。实验表明,所提出的 Treff 适配器在少样本和数据充足场景下,性能可与全监督方法和适配方法相媲美,甚至更优。尽管 Treff 适配器展示了将大规模预训练与领域特定知识的快速学习相结合对于获得少样本学习的通用表示具有重要意义,但目前仍仅限于音频分类任务。未来工作将探索如何在更广泛的音频领域中使用音频-语言模型。