OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2312.06109

Vary:让视觉语言模型更好理解文档与复杂版面

 
  attend ·  2026-08-14 11:01:16 · 13 次点击  · 0 条评论  

Vary:扩展大型视觉-语言模型的视觉词汇量

作者

Haoran Wei, Lingyu Kong, Jinyue Chen, Liang Zhao, Zheng Ge, Jinrong Yang, Jianjian Sun, Chunrui Han, Xiangyu Zhang

摘要

现代大型视觉-语言模型(LVLMs)共享相同的视觉词汇表——CLIP,该词汇表能够覆盖大多数常见视觉任务。然而,对于一些需要密集且细粒度视觉感知的特殊视觉任务,例如文档级OCR或图表理解,尤其是在非英语场景下,CLIP风格的词汇表在视觉知识分词方面可能效率低下,甚至遭遇词汇表外(out-of-vocabulary)问题。

为此,论文提出了 Vary,一种高效且有效的方法,用于扩展大型视觉-语言模型的视觉词汇量。Vary 的过程自然分为两个部分:新视觉词汇的生成与整合。

  • 第一阶段:设计了一个词汇网络以及一个微型的仅解码器Transformer,通过自回归方式生成所需的词汇。
  • 第二阶段:将新词汇与原词汇(CLIP)合并,扩展原始视觉词汇表,使LVLMs能够快速获取新特征。

与流行的 BLIP-2、MiniGPT4 和 LLaVA 相比,Vary 在保持原有能力的同时,展现出更优异的细粒度感知和理解能力。具体而言,Vary 胜任新的文档解析功能(OCR 或 markdown 转换),在 DocVQA 上达到 78.2% ANLS,在 MMVet 上达到 36.2%

主题/分类

  • 主分类:计算机视觉与模式识别(cs.CV)

其他信息

  • 提交日期:2023年12月11日
  • arXiv 编号:2312.06109
  • DOI:https://doi.org/10.48550/arXiv.2312.06109
13 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 14 ms
Developed with Cursor