NeFut Logo NeFut
EN 管理员登录

[AI学术] 对话风险累积框架:为多轮LLM系统提供状态保护

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Open Source

在大型语言模型(LLMs)的安全护栏中,大多数评估方法将每个提示-响应对孤立开来,忽略了在对话中逐渐累积的风险。我们将其称为对话风险累积(CRA),包括意图逐渐漂移、禁止指令的碎片化组装以及因重复披露而造成的敏感性累积。

为此,我们提出了一个会话层CRA框架,跟踪三种轨迹信号:

  1. 从会话锚点的语义漂移;
  2. 基于提取实体的信息累积图,考虑敏感性加权;
  3. 捕获合规性梯度信号,反映逐渐增加的合规意愿。

在评分方面,我们提供了:

为了基准测试CRA,我们发布了CRA-Bench v0.1(包含1200个八轮会话,涵盖三个威胁类别及其话题匹配的良性双胞胎)、CRA-Bench v0.2(LLM改述变体以减少模板伪影),以及一个扩展的五类别集(2000个会话,增加了角色引导和上下文填充)。

我们引入了一种轨迹原生的评估协议,包含会话级拆分、混合集阈值校准、轨迹AUROC、检测所需轮次、校准的假阳性指标、自助置信区间、一家庭留出诊断压力测试及合成到人类转移检查。主要关注于在CRA-Bench和人类转移子集上的会话评分。

博主点评: 该研究提出的对话风险累积框架为多轮对话中潜在的安全隐患提供了新的解决思路,强调了对话上下文的重要性,并通过创新的评分机制和基准测试推动了LLM安全性的研究进展。其方法将在未来的LLM应用中发挥关键作用,尤其是在涉及敏感信息的场景中。

原文链接: https://arxiv.org/abs/2607.19361

[h] 返回首页