NeFut Logo NeFut
EN 管理员登录

[AI学术] MetaRAG:信念-行动对齐的策略优化用于自主检索增强生成

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

Agentic 检索增强生成(RAG)要求语言模型在继续检索和直接回答之间做出决策。现有基于强化学习的方法依赖外部监督,忽视了模型对当前证据是否足够的内部信念。为此,MetaRAG 将搜索决策质量重新表述为信念‑行动对齐,并提出相应的策略优化框架。\ \ MetaRAG 引入 先验验证行动生成(Verify‑first Action Generation),在每一次实际行动前触发显式的验证过程;同时通过 内部信念探测(Internal Belief Probing),从同一问答历史上下文中估计策略模型自身的可回答性信念。基于这两者,系统计算 一致性奖励,并进一步由答案正确性进行门控,避免强化内部一致但答案错误的轨迹。信念探测仅在训练阶段使用,对推理时无额外开销。\ \ 在七个公开 QA 基准上的实验表明,MetaRAG 在保持或提升准确率的同时显著降低检索成本,相较于强基线的 RL‑based agentic RAG 有稳健提升。该优势在深度研究设置、不同优化器以及多种模型骨干上均能迁移。\ \ 博主点评:MetaRAG 通过显式建模模型的自我信念,巧妙地把内部一致性与外部正确性结合起来,为提升 RAG 系统的效率与可靠性提供了新思路。

原文链接: https://arxiv.org/abs/2608.24214

[h] 返回首页