NeFut Logo NeFut
EN 管理员登录

[AI学术] 正负样本学习用于代理安全误报审计

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

安全监视器用于保护与外部工具和环境交互的语言模型代理,但保守的监控会产生大量误报,导致审查资源消耗过大并削弱对警报的信任。误报和真实警报往往在监视器原始得分中交织在一起,仍需大量人工验证才能确定可靠阈值。实际场景中,可能只有少量已验证安全且未触发警报的轨迹,而所有警报均未标记,这自然把误报审计视为正负样本(PU)排序问题。

关键难点在于监视器引入的选择偏差:已观察到的安全参考是被监视器接受的,而我们真正关心的安全误报恰恰是被错误标记的,这导致观察到的正例并不能很好代表待恢复的正例。为此我们提出两阶段框架。

第一阶段是 Trust-aware PU Supervision,它将安全参考适配到警报域,并对可能的误报施加有限的负向压力,以防止它们被过度排除。第二阶段是 Reliability-gated Rank Distillation,将多个 PU 参考模型的一致排序偏好蒸馏到单一学生模型中。随后 Consensus-guided Structural Refinement 利用层次化的安全参考支持、警报之间的关系以及预测的参考共识,对学生模型的排序进行结构化优化。

该框架在训练时不需要任何警报安全标签,也不改变底层监视器。实验在主流安全监视器上验证,宏观 AUPRC 达到 $0.6444$,比八个基线提升 $5.27\sim16.98$ 个百分点;相较于最强基线 PULDA,在 5% 审查预算下能够额外恢复 33.3% 的误报。

点评

原文链接: https://arxiv.org/abs/2610.02925

下一篇:没有了
[h] 返回首页