摘要
在复杂文档上的问答(QA)需要模型能够检索和整合分布在远距离文档区域和多模态中的证据。多模态GraphRAG为此提供了一种有前景的方向,通过图结构组织文档证据。然而,现有方法常常面临不可靠的跨模态证据索引和昂贵的图遍历问题。为了解决这些问题,我们提出了HVM-GraphRAG,一个针对复杂文档的全视角多模态GraphRAG框架。
HVM-GraphRAG采用全视角来指导图的构建,从而减少噪声和冲突的图更新,并在概念级图节点与支持多模态片段之间建立可靠的索引。在检索过程中,HVM-GraphRAG在紧凑的概念级图上进行搜索,并通过构建的索引直接访问支持证据,避免在密集实体级图上的昂贵遍历。
在获取检索到的证据后,HVM-GraphRAG进一步将片段重组为特定模态的组,使得回答模型能够更好地整合异构证据。实验结果显示,HVM-GraphRAG在大多数评估设置中实现了最佳的答案表现,同时在在线检索效率上显著优于代表性的基于图的基线方法。
博主点评: HVM-GraphRAG通过全视角的方法解决了多模态图检索中的几个关键问题,展示了在复杂文档问答任务中的潜力。它的索引机制和片段重组策略显著提高了检索效率,为未来的研究指明了方向。整体而言,这是一个值得关注的进展。