NeFut Logo NeFut
EN 管理员登录

[AI学术] 强大的评论者:保护大语言模型免受多轮攻击

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Machine Learning

摘要

当用户向语言模型提出有害问题时,这是一种真正的攻击,还是一种误解但出于善意的问题?这种模糊性是大语言模型安全性的核心挑战之一。假设最坏情况的模型会伤害到合法用户,而假设最好情况的模型则容易被利用。在多轮对话中,这一问题更为复杂,攻击者的真实意图可能在多个交流中逐渐显现,而现有的安全框架则应用了上下文赌博的处理,忽视了对话的轨迹。

为此,我们提出了对话评论员引导采样(DCGS)框架,该框架通过推断每轮对话中的用户意图来解决这一问题。DCGS不再使用固定规则判断什么是安全的,而是根据完整的对话历史学习用户意图,并相应生成回应。形式上,我们将对抗性对话建模为马尔可夫决策过程,并在单个标记和话语(完整回应)级别学习基于价值和遗憾的评论员,通过动作值评论员对候选回应进行评分。我们证明,这种推断时的重加权近似于基础策略的指数倾斜,保证了对任何有限候选池的预期收益改进,而群体相对目标并不具备这一特性。

在CARES-18k、WildJailbreak、Redbench和Harmbench上的评估显示,DCGS在对抗性对话任务中超越了强有力的鲁棒基线和前沿模型。DCGS还能够迁移到前沿模型,提升其鲁棒性而无需微调。

博主点评: 本文提出的DCGS框架为多轮对话中的用户意图推断提供了创新的方法,显著提升了大语言模型的安全性和鲁棒性。这种基于对话历史的动态学习策略,展现了机器学习在处理复杂交互中的潜力,值得进一步探索与应用。

原文链接: https://arxiv.org/abs/2607.20472

[h] 返回首页