每个文档问答系统都必须在页面图像、提取文本或两者之间做出输入选择,但该选择很少单独研究。我们在保持提示、评判器和评分流水线不变的前提下,分别在四个商业模型接口、两个语料库以及两种上下文模式(金标准证据页和完整文档)上进行对比实验。结果显示,只要图像预算足够,页面图像在所有文档长度上都能取得更高的准确率,但随文档变长,图像的延迟和成本会持续上升,而文本的延迟基本保持平稳。文本和图像在不同问题上各有失误,约有 19%–25% 的条目只有一种表示是正确的,说明两者互补且不存在全覆盖。利用这一互补性,我们构建了一个仅读取问题文本的轻量级 TF‑IDF 路由器,在文档不重叠的持出集上相较于始终使用文本的方案提升 2.6 分,同时相较于始终使用视觉的方案将中位延迟降低约 30%。
点评