DNAlign 是一种轻量级的安全对齐框架,结合了控制理论优化与零空间投影。我们将大语言模型视为动态系统,在生成过程中引入可控扰动,使输出倾向于安全行为。核心的投影模块利用中性隐藏状态构建的有害子空间,将扰动限制在该子空间内,从而保留模型的通用知识和响应质量。
价值函数基于人类偏好数据进行训练,能够自适应地优化控制信号,使其符合人类的安全偏好。对多种 LLM 主干模型的广泛实验表明,DNAlign 能显著降低有害输出,同时保持流畅性、一致性和事实准确性。相较于已有对齐基线,本文方法在不牺牲生成多样性的前提下实现了更优的整体性能,展示了在实际部署中实现安全对齐的可行性。
点评