在增强检索的大语言模型中,常常面临有用证据与误导性陈述或指令内容交织的上下文。简单拒绝会丢弃有效证据,而不加选择地采纳则可能导致错误或不安全的答案。
因此,能够选择性地采纳相关信息并拒绝欺骗性或有害内容,对于在实际检索环境中的可靠部署至关重要。我们介绍了 SelectBench,一个用于选择性证据采纳的控制基准和训练集,并直接使用 DAPO 对 Qwen3.5-4B 进行后训练,采用确定性规则奖励或冻结的语义评估器。
在经过修正的 325 个示例的 SelectBench-v2 测试集中,严格成功率从原始检查点的 22.46% 提升至 DAPO-Rule 的 25.54% 和 DAPO-DeepSeek 的 26.46%。这两种训练策略减少了禁止内容的采纳,并生成了更短、更集中的响应,但后续的提示注入并没有改善。
虽然这些增益较为有限,但在 Holm 校正后未能存活,表明可能需要更强的奖励塑形或额外的训练迭代以获得更稳健的提升。DAPO-DeepSeek 在 MMLU 或干净的 HotpotQA 上未表现出实质性降级,表明后训练过程保持了模型的通用能力。
这些结果展示了在选择性证据使用上的方向性改进,同时也识别出注入抵抗和统计稳健性作为未来工作的主要挑战。
博主点评: 本文展示了在复杂检索环境中,使用强化学习来提升大语言模型选择性证据采纳能力的潜力。尽管进展有限,但为未来的研究指明了方向,尤其是在奖励设计和训练策略的改进方面,期待后续成果能带来更显著的提升。