NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过反向对齐少样本对话暴露实现LRM对齐

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#Machine Learning #LLM #Artificial Intelligence

大型推理模型(LRM)依赖显式的思维链(CoT)推理和大上下文窗口来在复杂任务上取得强性能,但这些特性也带来了新的攻击面。我们发现,通过在输入前添加包含显式CoT轨迹的反向对齐少样本对话,可以系统性地引导LRM的推理过程,使其在有害查询上生成不安全内容,在良性查询上出现不必要的拒绝。我们将此攻击形式化为 SRCF(Steering Reasoning via Counter-Aligned Few-shot Conversations),它仅通过灵活的对话接口操作,无需访问模型参数或梯度。核心洞察在于 SRCF 利用一种对抗性泛化问题导致表示漂移,使得良性和有害输入的内部表征在相同方向上偏移。基于此观察,我们提出了后训练防御 ARCF(Aligning Reasoning via Counter-Aligned Few-Shot Conversations),在训练时让模型接触反向对齐的对话上下文并强制对齐目标。ARCF 与现有后训练方法兼容,能够持续提升安全性和有用性且不降低模型效用。

点评:该工作通过简单的对话层面干预揭示了 LRM 的潜在脆弱性,并提供了可直接集成的防御方案,为提升大模型安全性提供了实用路径。

原文链接: https://arxiv.org/abs/2609.27763

[h] 返回首页