文档解析是文档理解任务的基础步骤,例如视觉问答和关键信息提取。它通过提取文本、视觉和布局信息,将非结构化的扫描图像转化为结构化表示。虽然已经开发了众多光学字符识别(OCR)引擎和多模态大语言模型(MLLMs),但在标签稀缺的情况下,为给定文档集合选择合适的文档解析解决方案依然具有挑战性。
在本研究中,我们对多种OCR引擎和最先进的MLLMs在不同领域和语言的多个扫描文档基准上的文本识别性能进行了系统评估。考虑到许多OCR引擎的上下文推理能力有限以及人工标注的高成本,我们提出了DocOCR-Eval,这是一种无标注的自动OCR评估与选择框架。DocOCR-Eval采用三阶段的纠正与排名策略,旨在在没有真实标签的情况下近似标注基础的工具排序。
我们的研究表明,通过聚合多个MLLM的结果,可以逐步改善与标注基础排名的对齐程度。大量实验进一步证明,在现实的标签有限环境中,可以实现可靠的OCR工具选择,为在多样化的真实文档集合中部署文档解析系统提供实用指导。
博主点评:DocOCR-Eval框架在无标注情况下提供了有效的OCR工具选择策略,具有重要的实用价值,特别是在资源有限的场景中。其三阶段的纠正与排名策略为文档解析领域带来了新的思路,推动了OCR技术的应用与发展。