NeFut Logo NeFut
EN 管理员登录

[AI学术] JevAdvBench:针对强化学习校准决策模型的基准与黑盒攻击

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning

模型通过强化学习进行校准决策(RLCD),如 Jev,能够对输入状态给出概率、选项或分数等结构化答案,系统直接依据答案执行而无需人工阅读。

这些模型的鲁棒性尚未得到系统评估。传统对抗基准关注生成的文本或执行的指令,而 RLCD 模型即使被干扰仍会返回格式正确的答案,导致评估困难。

评估难点在于同一请求可能产生不同答案,标签多数来源于模型自身,且 API 在后台对请求进行不可见的预处理。

我们的核心思路是将每一次被攻击的决策与模型在干净环境下的同一次决策进行比较,而不是与外部标签比较,并以一次相同重跑的变化作为基准。

基于此思路,我们构建了 JevAdvBench——目前已知的首个针对 RLCD 模型的对抗基准。基准包含 812 条结构化问题,覆盖 66 种场景,并提供 9,744 条单编辑黑盒攻击变体,每条变体都通过计费的输入 token 证明编辑已送达模型。

在 jev-1.13.0 上实验表明,重新措辞导致的决策变化不超过 1.2 个百分点,超出模式的字段根本不会进入模型。相反,向状态中追加未经验证的观点会使 12.1% 的决策翻转,效果与最强注入指令(10.1%)相当,并将 38% 的高置信度答案压低至 0.8 以下的阈值,从而触发人工复审。

因此,基于 RLCD 模型构建的应用应将状态视为不可信的外部输入。

点评:JevAdvBench 为 RLCD 系统提供了可操作的安全评估手段,揭示了即使是微小的文本干扰也可能导致显著的决策偏移,提醒开发者在设计系统时必须对输入进行严格过滤和审计。

原文链接: https://arxiv.org/abs/2609.31142

[h] 返回首页