NeFut Logo NeFut
EN 管理员登录

[AI学术] 纠缠墙:激活空间探测器作为风险检测器而非上下文裁决者

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#algorithm #AI #Machine Learning

摘要

上下文可以改变请求是否有害,而不改变其主题或表面形式。我们探讨了残差流探测器是否能在有用的操作点上区分有害请求与表面匹配的良性控制。在三种7-8B模型系列中,激活传感器阻止了95.5%-97.7%的判定为合规攻击的请求,并且在选定的分类集中也阻止了59.6%-68.4%的XSTest提示。完全独立的审计重构了近极限的源对比AUROC(0.996-0.999),但在匹配对的固定转移上表现较弱:在防护选定的Twin-n70子集上为0.656-0.819,而在完整的Twin-n163队列上为0.590-0.690。我们在参考系列上测试了十个轴,在所有系列中测试了七个轴,使用了泄漏、保留和置换控制。在Twin-n163上,未经过直接配对边界拟合评估的任何轴都未达到指定的数值阈值。要求在整个队列上保持一致性是在分析时添加的。一个单独指定的24B/32B扩展给出了相同的结果。经过配对训练的分类器在类别和生成批次保留下表现较弱,导致在95%的语料库真实正例率下错误阻止79.6%-100%的XSTest请求。在测试的读取点上,这些激活分数表现为广泛的风险检测器,而非独立的上下文裁决者。

博主点评: 本文展示了激活空间探测器在识别有害请求方面的潜力,尤其是在上下文变化的情况下。通过高效的传感器,能够在多种模型中保持较高的准确率,然而,模型在特定条件下的表现仍需进一步优化,以增强其在不同环境中的适应性与有效性。

原文链接: https://arxiv.org/abs/2607.13075

[h] 返回首页