NeFut Logo NeFut
EN 管理员登录

[AI学术] 理性解释传达了什么?角色专化问答中的信息干预研究

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

角色专化的问答(QA)流水线常常把推理器生成的理性解释(rationale)传递给验证器,但到底带来了哪些收益仍不明朗。我们提出一种信息干预诊断方法:在固定证据和候选答案的前提下,仅改变跨越推理器‑验证器边界的理性解释。实验在 400 条 MuSiQue、HotpotQA 与 2WikiMultiHopQA 示例上进行,使用 DeepSeek 同时担任生成器和验证器。结果显示,忠实的理性解释相较于不提供理性解释几乎不提升答案准确率;而被篡改的理性解释会显著改变支持判断。

在盲验证器提示下,轻微的同义改写仅使支持率变化 0‑2.5%,而被破坏的理性解释导致 10‑22% 的变化;加入显式的理性检查提示后,这一差异放大至 34‑55%。最终答案的变化幅度较小(2‑30%),且只有 2.9‑35.3% 的支持翻转伴随答案改变。人工审计进一步揭示问题:在 42 起有效篡改中有 16 起属于“篡改‑过度信任”情形,盲测人类会拒绝或标记为不明确的 9/10 篡改理性解释,却被模型接受。跨模型与任务边界的检查表明,信息通道可以是活跃的、被放大、惰性的,或直接折叠进任务标签。

因此,理性解释的共享应被视作一种验证‑信息机制进行评估,而非仅仅追求更高的答案准确率的手段。

点评:本研究通过精细的干预实验,厘清了理性解释在 QA 系统中的真实作用,提醒研究者在设计管线时关注信息传递的可靠性与潜在风险。

原文链接: https://arxiv.org/abs/2610.00018

[h] 返回首页