OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/1912.13318

LayoutLM:联合建模文本与版面结构的文档理解预训练方法

 
  macbook ·  2026-07-24 11:01:18 · 9 次点击  · 0 条评论  

LayoutLM: 文本与布局的预训练在文档图像理解中的应用

核心信息

  • 论文标题:LayoutLM: Pre-training of Text and Layout for Document Image Understanding
  • 作者:Yiheng Xu, Minghao Li, Lei Cui, Shaohan Huang, Furu Wei, Ming Zhou
  • 所属机构:Microsoft(根据作者单位)
  • 发表会议:KDD 2020
  • arXiv ID:1912.13318
  • 提交时间:2019年12月31日(v1),最后修订于2020年6月16日(v5)

摘要

近年来,预训练技术在多种自然语言处理(NLP)任务中取得了成功。然而,现有的NLP预训练模型几乎仅关注文本层面的操作,忽略了对于文档图像理解至关重要的布局和样式信息。本文提出了 LayoutLM,用于联合建模扫描文档图像中文本与布局信息之间的交互,这对于许多现实世界的文档图像理解任务(如从扫描文档中提取信息)非常有益。此外,我们还利用图像特征将单词的视觉信息融入LayoutLM。据我们所知,这是首次在单一框架中联合学习文本与布局以进行文档级预训练。该模型在多个下游任务中取得了新的最优结果,包括表单理解(从 70.72 提升至 79.27)、收据理解(从 94.02 提升至 95.24)和文档图像分类(从 93.07 提升至 94.42)。代码和预训练模型已开源。

主题/分类

  • 主要分类:计算机科学 - 计算与语言(cs.CL)

关键词

  • LayoutLM
  • 文档图像理解
  • 文本与布局联合建模
  • 预训练
  • 扫描文档信息提取
9 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 12 ms
Developed with Cursor