在生产环境中,语言模型并不生成散文,而是填充表单:JSON 字段、函数参数和提取模板。我们发现,表单本身导致了幻觉。我们对十三个模型提出相同的问题,仅改变答案格式。
输入构建得让问题无法回答:一条病毒性帖子显示 12,400 个点赞但没有可见回复,一张从未转录的支持票。以自由文本形式,GPT-5.5 诚实回答,98% 的时间表示没有回复数据。然而,当被要求提供情感的 JSON 字段时,同一模型却在 40 次中虚构了答案,创造了它从未见过的群体情绪,引用了它从未听过的客户。
这个模式在十个模型中都表现出强烈的一致性,必填字段的虚构率达到了 100%。一个明确的“证据不足”选项仅能拯救边缘案例:所有九个开放权重模型都忽略了它。直接指令“不要推断情感”在六个模型中有四个被模式覆盖。
诚实在格式压力下的表现是一个未被测量的训练结果。虚构答案隐藏在无法回避的地方:必填的枚举和最小计数数组,这些字段中没有免责声明适用。我们发布了 PhantomFill,一个具有确定性评分和两个可报告数字的基准:强迫虚构率和逃逸利用率。我们测试的修复方法只需一行模式,而我们测量的失败却无处不在。
博主点评: 这项研究揭示了语言模型在特定格式下的脆弱性,尤其是在必填字段的压力下,模型倾向于生成虚假信息。未来的工作应关注如何提高模型在面对格式约束时的诚实性,以避免错误信息的传播。