摘要
遵循包含多个显式约束的复杂指令是大型语言模型(LLMs)面临的一项基本挑战。现有的对齐方法,如 DPO,优化整体奖励信号,往往对个别约束的严格满足重视不足,尤其是在分布外或多约束设置下。
本文提出了 STAIF,一个阶段性优化框架,旨在将主观(软)约束的对齐与客观可验证(硬)约束的优化解耦。
方法概述
- 阶段 1:应用偏好优化与多个负样本,以提高对软约束的敏感性。
- 阶段 2:采用可验证奖励的强化学习(RLVR),以严格执行对硬约束的合规性。
为支持该方法,我们构建了 STAINSTRUCT,一个高质量的双语(英语、中文)数据集,包含约 31,000 个复杂的多约束指令。大量分析验证了 STAIF 的设计,并在强基线对比下展示了在代表性基准上的最先进性能以及真实的泛化能力。
博主点评: STAIF 的阶段性优化方法通过分离软硬约束的处理,为复杂指令的执行提供了新的思路。这一创新不仅提升了模型的灵活性,还在多约束环境下增强了指令遵循的准确性,标志着大型语言模型在处理复杂任务时的一次重要进步。