Xianming Li, Zongxi Li, Jing Li, Haoran Xie, Qing Li
现有的句子嵌入方法通常依赖语言模型生成固定长度的嵌入向量,用于语义文本相似度(STS)等下游任务。由于不同应用场景的计算约束和预算未知,这类方法在灵活性上存在局限。Matryoshka Representation Learning (MRL) 通过以更细粒度(即更低嵌入维度)编码信息,能够自适应地适配临时任务,在较小嵌入尺寸下达到相近的准确率,从而加速下游任务。然而,即使 MRL 提升了效率,它仍然需要遍历全部 Transformer 层才能获得嵌入,这依然是时间和内存消耗的主导因素。这引发了对两个问题的思考:固定的 Transformer 层数是否影响表示质量,以及使用中间层进行句子表示是否可行。
本文提出了一种新颖的句子嵌入模型——二维 Matryoshka 句子嵌入(Two-dimensional Matryoshka Sentence Embedding, 2DMSE)。该模型支持嵌入尺寸和 Transformer 层数的弹性设置,比 MRL 具有更高的灵活性和效率。作者在 STS 任务和下游应用上进行了大量实验,实验结果证明了所提模型在动态支持不同嵌入尺寸和 Transformer 层数方面的有效性,使其能够高度适应各种应用场景。