LensVLM:文本压缩视觉表示的选择性上下文扩展
LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
摘要
LensVLM 是一个针对视觉语言模型(VLM)的推理框架和后训练方案,旨在解决文本渲染为图像时因压缩程度增加导致的准确率下降问题。该方法通过调整渲染分辨率实现细粒度压缩,但字符缩小至低于编码器有效分辨率时难以区分。LensVLM 使 VLM 能够扫描图像中的文本,无需将文本分词为长 token 序列。
视觉语言模型(Vision Language Models,VLMs)提供了将文本作为渲染图像进行处理的令人兴奋的可能性,从而无需将文本分词为长 token 序列。由于 VLM 图像编码器将固定尺寸的图像映射为固定数量的视觉 token,改变渲染分辨率便提供了一种细粒度的压缩手段。然而,随着压缩程度增加,准确率会迅速下降:字符缩小到低于视觉编码器的有效分辨率,导致它们难以区分。为解决这一问题,我们提出了 LensVLM,一个推理框架和后训练方案,使 VLM 能够扫描……
译自 Apple · ML Research · 录于 二〇二六年七月八日