在大型语言模型(LLM)中,迎合(sycophancy)和幻觉(hallucination)是跨领域的常见失效模式。尤其在临床问答场景,模型必须严格依据提供的电子健康记录(EHR)上下文作答,并且要抵御用户的压力。幻觉会导致模型生成未被上下文支持的信息,迎合则会在用户质疑时放弃原本正确的答案。现有方法如基于提示的安全措施或全局激活引导,往往只针对单一行为或在所有对话轮次都施加干预,容易削弱已经正确的回答。
为了解决这些问题,我们在单一框架内采用推理时干预(Inference Time Intervention, ITI),通过对比临床问答对学习两套独立的引导方向:一套抑制幻觉,一套抑制迎合。该引导方向被映射到因果验证的注意力头上。运行时,行为特定门控会判断是否需要介入:幻觉门控负责削弱未被上下文支持的陈述,迎合门控负责防止在用户压力下答案的偏移。
我们在基于真实 EHR 数据的临床问答上进行评估,保持模型权重冻结。共执行 15,900 次模型响应实验,其中包括 600 条针对 40 亿参数模型的压力轨迹。未使用引导的模型在 570 起情况下屈服,而使用门控引导后,有 551 起成功抵御压力,表现相当于参数规模超过 1000 亿的模型。结果表明,针对性的推理时引导能够在不频繁干预的前提下显著提升模型的鲁棒性。
博主点评:该工作展示了在高风险医学场景中,通过细粒度的注意力头控制实现行为调节的可行性。相比全局干预,门控引导在保持原有回答质量的同时,有效抑制了幻觉和迎合,是提升 LLM 临床安全性的关键一步。