摘要
高温采样是提升大语言模型(LLM)输出多样性的主要机制之一。最近在基于截断的采样技术方面的进展,帮助缓解了高温采样的缺陷,如神经文本退化,从而在不牺牲连贯性的情况下,实现更大的多样性。然而,通过高温增加令牌概率分布的熵也被证明削弱了模型的保护机制,降低了模型在有害提示下的拒绝响应。尽管高温采样具有潜在好处,并且保持模型安全性至关重要,但目前缺乏在高熵环境下维持 LLM 拒绝行为的现有解决方案。
为了解决这一问题,我们系统地研究了温度如何影响 LLM 的拒绝行为,并提出了一种高效的顺序解码方法,该方法在高温下保持模型的贪婪解码拒绝响应,同时增加的延迟最小。通过广泛的实验,我们展示了我们的方法能够在三个基准数据集上保持 91-99% 的贪婪解码拒绝行为,而不影响模型对安全提示的高温响应。我们的工作展示了如何以高效的方式维护拒绝行为,以满足需要高温采样的应用需求。
博主点评: 该研究对高温采样下的模型安全性提供了重要的见解,通过引入拒绝门控解码方法,显著提升了 LLM 在处理有害提示时的防护能力。此方法的有效性和低延迟特性为未来的安全应用奠定了基础,展现了在多样性与安全性之间的平衡可能性。