Bailin Wang、Richard Shin、Xiaodong Liu、Oleksandr Polozov、Matthew Richardson
在将自然语言问题转换为 SQL 查询以回答数据库相关问题的任务中,当前的语义解析模型难以泛化到未见过的数据库模式(schema)。泛化挑战主要在于:(a) 以语义解析器可访问的方式编码数据库关系;(b) 建模数据库列与其在给定查询中提及之间的对齐关系。
本文提出了一个基于关系感知自注意力机制(relation-aware self-attention mechanism) 的统一框架,在 Text-to-SQL 编码器中同时解决 模式编码(schema encoding)、模式链接(schema linking) 和特征表示(feature representation) 三个问题。
在具有挑战性的 Spider 数据集 上,该框架将精确匹配准确率提升至 53.7%,而未经 BERT 嵌入增强的当前最优模型准确率为 47.4%。此外,研究还观察到模型在模式链接和对齐理解方面的定性改进。