在真实文档中回答问题往往需要处理包含文本和表格的长输入。光学上下文压缩把上下文转为图像,可以显著降低 token 消耗,但对表格理解的影响尚不明确。我们针对多表文档问答进行像素级表格压缩研究,评估了五种视觉语言模型(VLM),使用两个基准数据集和五种视觉‑token 预算。实验表明,保持表格原始分辨率的图像表示在性能和效率上与文本等价;而对表格进行下采样会导致模型用更长且效果更差的推理路径来弥补可读性下降,抵消了预期的 token 节省。即便在高度下采样的情况下,模型仍能辨别表格是否与问题相关。基于此不对称特性,我们提出一种无需额外训练的两步方法:首先在像素压缩的上下文中识别出回答问题所需的表格,然后对这些表格使用原始分辨率进行推理。对长文档实验显示,该方法相较于单步使用原始分辨率表格的 QA 可节省 41% 的总 token,并提升 7 个准确率点;同时相比最省 token 的单步压缩配置,使用的 token 少 15%,且不损失准确率。
博主点评:该工作展示了在保持关键信息的前提下,利用低分辨率图像快速筛选相关表格,再高分辨率细化推理的实用思路,为大模型处理长文档提供了高效新路径。