DocAnnot:利用GenAI加速关键信息提取数据集的创建
关键信息提取(KIE)对许多文档应用至关重要,但创建训练数据集通常是一个耗时的手动过程。我们介绍了DocAnnot,一个显著加速KIE数据集生成的框架。
DocAnnot利用大型视觉语言模型(LVLM)进行标签值提取,使用光学字符识别(OCR)进行文本和边界框检测,并采用新颖的空间信息上下文匹配(SICM)算法。SICM通过结合空间关系和邻近分析与文本匹配,提高了标签值的关联性。
我们在CORD和SROIE基准上评估了我们的框架,展示了其自动生成注释的能力,F1分数分别为0.679和0.846。此外,我们还研究了使用自动标注数据微调下游KIE模型的有效性。尽管人工标注数据仍然优越,但仅使用DocAnnot输出训练的模型也能达到令人满意的性能(例如,LayoutLMv3在CORD上达到F1分数0.6765)。
这些结果表明,尽管我们的框架显著减少了对手动工作的依赖,但尚未完全消除对人工干预的需求。然而,通过将自动化过程提升到审阅者可以高效精炼输出的程度,我们的系统能够实现几乎完美的注释,效率远高于从头开始的手动注释。这种方法提供了显著的时间和成本节约,使其在资源受限的环境和快速模型原型设计中具有重要价值。
博主点评: DocAnnot通过结合LVLM与SICM算法,展现了现代技术在信息提取领域的强大潜力。这种自动化解决方案不仅提高了数据集创建的效率,还为后续模型的训练提供了坚实基础,值得在更多应用场景中推广。