LayoutLM: 文本与布局的预训练在文档图像理解中的应用
核心信息
- 论文标题:LayoutLM: Pre-training of Text and Layout for Document Image Understanding
- 作者:Yiheng Xu, Minghao Li, Lei Cui, Shaohan Huang, Furu Wei, Ming Zhou
- 所属机构:Microsoft(根据作者单位)
- 发表会议:KDD 2020
- arXiv ID:1912.13318
- 提交时间:2019年12月31日(v1),最后修订于2020年6月16日(v5)
摘要
近年来,预训练技术在多种自然语言处理(NLP)任务中取得了成功。然而,现有的NLP预训练模型几乎仅关注文本层面的操作,忽略了对于文档图像理解至关重要的布局和样式信息。本文提出了 LayoutLM,用于联合建模扫描文档图像中文本与布局信息之间的交互,这对于许多现实世界的文档图像理解任务(如从扫描文档中提取信息)非常有益。此外,我们还利用图像特征将单词的视觉信息融入LayoutLM。据我们所知,这是首次在单一框架中联合学习文本与布局以进行文档级预训练。该模型在多个下游任务中取得了新的最优结果,包括表单理解(从 70.72 提升至 79.27)、收据理解(从 94.02 提升至 95.24)和文档图像分类(从 93.07 提升至 94.42)。代码和预训练模型已开源。
主题/分类
- 主要分类:计算机科学 - 计算与语言(cs.CL)
关键词
- LayoutLM
- 文档图像理解
- 文本与布局联合建模
- 预训练
- 扫描文档信息提取