Haoran Wei, Lingyu Kong, Jinyue Chen, Liang Zhao, Zheng Ge, Jinrong Yang, Jianjian Sun, Chunrui Han, Xiangyu Zhang
现代大型视觉-语言模型(LVLMs)共享相同的视觉词汇表——CLIP,该词汇表能够覆盖大多数常见视觉任务。然而,对于一些需要密集且细粒度视觉感知的特殊视觉任务,例如文档级OCR或图表理解,尤其是在非英语场景下,CLIP风格的词汇表在视觉知识分词方面可能效率低下,甚至遭遇词汇表外(out-of-vocabulary)问题。
为此,论文提出了 Vary,一种高效且有效的方法,用于扩展大型视觉-语言模型的视觉词汇量。Vary 的过程自然分为两个部分:新视觉词汇的生成与整合。
与流行的 BLIP-2、MiniGPT4 和 LLaVA 相比,Vary 在保持原有能力的同时,展现出更优异的细粒度感知和理解能力。具体而言,Vary 胜任新的文档解析功能(OCR 或 markdown 转换),在 DocVQA 上达到 78.2% ANLS,在 MMVet 上达到 36.2%。