在高风险领域(如医疗)中,隐私保护和事实准确性同等重要。我们发现并系统研究了差分隐私(DP)语言模型中的隐私‑幻觉权衡。实验表明,使用DP进行预训练或微调的模型比非DP模型更容易产生幻觉,且随着隐私预算(ε)收紧,幻觉的频率和严重程度均会提升。进一步分析发现,DP机制会使输出分布趋于平坦,导致概率质量向事实错误的候选词重新分配。为验证信息频率的影响,我们在训练数据中控制事实出现的频率,结果显示更高的事实出现频率可以在一定程度上降低DP模型的幻觉风险。整体结论是,必须设计更细致的隐私保护方法,在提供严格隐私保证的同时,避免牺牲事实准确性。
点评