NeFut Logo NeFut
EN 管理员登录

[AI学术] 叙事囚禁:多轮 LLM 对话中的判断偏移

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #LLM

人们日益依赖大语言模型(LLM)获取日常建议,尤其是涉及伦理冲突的情境,这使得道德咨询成为实际的应用场景。以往研究大多聚焦于单轮判断或带有强硬反驳的情形,这些假设与真实世界中人们寻求指导的方式不符。于是我们提出了 narrative captivity(叙事囚禁)这一失效模式:模型在面对单方面、未被挑战的叙述时,将其视为完整信息并直接采纳叙述者的解释,而不主动寻找缺失的视角。

为量化该现象,我们构建了一个包含 5,078 条人际冲突情景的基准,覆盖六个道德维度。实验在 17 种 LLM 上进行,结果显示,多轮叙事下的最终判断相较于对应的单轮基线平均偏移 25 个百分点,表现出广泛的叙事囚禁现象。进一步的阶段分析表明,模型的偏好优化是主要驱动因素;我们尝试的四种推理时策略只能提供有限的缓解。

我们期望本工作能够推动 LLM 咨询系统在真实场景中保持独立判断,避免被单向叙事所左右。

点评

原文链接: https://arxiv.org/abs/2609.03407

[h] 返回首页