NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越拒绝模式:安全角色内化实现稳健且可推广的 LLM 安全对齐

发布于:2026-10-07 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #LLM

大型语言模型(LLM)在生成能力上取得显著进展,但仍易受到 jailbreak 攻击,导致输出有害或不安全。现有的安全对齐方法,如监督微调(SFT)和基于人类反馈的强化学习(RLHF),往往需要大量针对攻击的标注和计算资源,且仍会出现浅层对齐和过度拒绝的问题。\ \ 为了解决这些瓶颈,我们提出 SSRFT(Supervised Safe-Role Fine-Tuning),首次将安全对齐重新表述为预定义安全角色的内化过程。SSRFT 通过心理测量题、有限的 jailbreak 提示以及安全角色描述,构建 Safe-Role Question-Answer(SRQA)数据集。角色一致的回答先由模型合成,再经过人工或自动验证,随后在多样化情境下扩展,形成覆盖广泛的训练样本,使模型学习安全价值观和原则,而非单纯的拒绝模式。\ \ 实验在多种 Base 模型和 Instruct 模型上进行,对比标准 SFT。结果显示,SSRFT 在前缀注入攻击下表现出更高的鲁棒性,对未见的 jailbreak 领域也能更好地泛化;同时在普通查询上显著降低了过度拒绝率,且保持了模型的通用生成能力。\ \ 这些发现表明,安全角色内化是一种有效的、超越拒绝中心的安全对齐策略,为构建更可靠的 LLM 提供了新路径。\ \ 点评:SSRFT 通过角色内化实现了更稳健、更通用的安全对齐,值得在实际部署中进一步验证与推广。

原文链接: https://arxiv.org/abs/2610.07023

[h] 返回首页