在科学文档的领域特定问题回答中,大型语言模型(LLM)常常出现幻觉现象,特别是在没有经过特定领域微调的情况下。现有的检索增强生成(RAG)方法虽然部分解决了这一问题,但仍面临诸多挑战,包括有限的上下文知识、稀疏与密集检索的差异以及检索噪声等。本文提出了一种先进的多模态检索增强生成系统,旨在解决这些挑战并提高信息提取的准确性。
该架构引入了一个多模态输入管道,利用开源视觉语言模型(Qwen2-VL-2B-Instruct)生成表格和图形的文本摘要。在检索阶段,系统结合了基于 HNSW 的语义搜索与基于 GIN 的词汇搜索,通过互惠排名融合(Reciprocal Rank Fusion)统一处理,并使用交叉编码器重排序(Cross Encoder reranking)来减少检索噪声。为了确保多轮交互中的对话连贯性,采用了查询浓缩模块(Query Condenser)。
评估通过独立评估输入、检索和生成阶段进行,使用了 MMLongBench 基准测试、BeIR 格式的合成数据集和 DeepEval 框架。结果表明,检索质量较 Naive-RAG 基线提升了 157%,额外延迟仅为 50 毫秒,同时 Qwen2-VL-2B-Instruct 在 BERTScore 中的表现与基于云的模型相当。这些发现验证了开源优化的 SLM 与先进检索策略相结合,能够在文档理解中提供竞争力的表现,而无需依赖云模型。
博主点评: 本文展示了一种创新的多模态检索增强生成系统,显著提升了科学文档理解的能力。通过结合不同的检索策略与开源模型,该系统在处理复杂信息时表现出色,未来在科研领域的应用前景广阔。值得注意的是,减少依赖云服务的优势,将推动更多的本地化解决方案发展。