事实幻觉通常指模型输出的事实错误。本文关注一种同义句诱导的幻觉情形:模型在原始问题上能够给出正确答案,但在语义等价的同义句下却产生错误答案。这类不一致揭示了在语义不变性下潜在的事实不稳定性。常规的同义句往往难以提供有效的鲁棒性监督——近似复制的同义句信号弱,过于多样的同义句又可能破坏语义等价。为此我们提出 HALLUCINATION‑R1,一个面向鲁棒性的同义句生成框架,旨在学习生成既保持语义又能挑战下游问答模型事实一致性的同义句。框架采用两阶段优化:第一阶段通过意义保持约束和多样性奖励稳定生成多样同义句;第二阶段对能够导致下游模型事实一致性下降的同义句给予额外奖励。实验在 SimpleQuestions、PopQA 和 TruthfulQA 上进行,结果表明 HALLUCINATION‑R1 在一致性‑多样性之间取得了良好平衡,并在多个模型族和数据集上暴露出鲁棒性失效。进一步分析显示,这些失效并非表层噪声或语义漂移所致,而是意义保持变化下的非平凡事实不稳定性。轻量化微调实验表明,使用 HALLUCINATION‑R1 生成的数据进行训练可提升模型在同义句变体下的鲁棒准确率,证明其在鲁棒性导向训练中的实用价值。代码与模型已公开于 https://github.com/yuwenhan07/Hallucination-R1。
点评:该工作通过精心设计的生成与奖励机制,提供了一套系统化的方法来评估并提升问答模型的事实鲁棒性,为后续的鲁棒性训练提供了可复用的数据来源。