在后期训练对齐过程中,通常会减少大型语言模型(LLM)的多样性,这种现象被称为模式崩溃。不同于以往将此效应归因于算法限制的研究,我们识别出一个根本且普遍的数据层面驱动因素:偏好数据中的典型性偏见。具体而言,注释者由于认知心理学的研究结果,系统性地偏好熟悉的文本。
我们在理论上形式化了这种偏见,并在偏好数据集上进行了实证验证,证明其在模式崩溃中起着核心作用。基于这一分析,我们提出了一种简单的、无训练的提示策略——语言化采样(Verbalized Sampling,VS),旨在规避模式崩溃。VS通过提示模型对一组响应(例如“生成5个关于咖啡的笑话及其对应的概率”)进行概率分布的语言化,从而提升多样性。
综合实验表明,VS在创意写作(如诗歌、故事、笑话)、对话模拟、开放式问答和合成数据生成等任务中显著提升了性能,而未牺牲事实准确性和安全性。例如,在创意写作中,VS使得多样性提高了1.6至2.1倍。我们进一步观察到,能力更强的模型从VS中获益更大。总之,我们的工作提供了一种关于模式崩溃的新数据中心视角和一个实用的推理时解决方案,帮助解锁预训练生成模型的多样性。
博主点评: 语言化采样作为一种新颖的提示策略,展现了在保持准确性和安全性的前提下,如何有效提升LLM的创造性输出。这种方法不仅有助于解决模式崩溃问题,更为LLM的多样化应用开辟了新的方向。其理论与实证结合的研究也为未来的模型优化提供了重要启示。