NeFut Logo NeFut
EN 管理员登录

[AI学术] 安全超越接口:通过大语言模型潜在状态检测有害内容

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #LLM

随着自主系统对大语言模型(LLM)的依赖日益加深,围绕这些模型的安全防护往往带来额外的延迟和计算开销,限制了资源受限、时限严格的场景的实用性。传统的外部守护模型只能观察模型的输入输出,无法直接感知模型内部的状态,导致安全保障存在根本性的盲区。我们提出一个核心问题:模型本身是否已经能够辨识出有害内容?

为验证这一假设,我们从 LLaMA-3.1-8B 中抽取隐藏层激活,并训练了轻量级的 MLP 探针(参数量 12.6M),用于对有害提示进行二分类。探针的训练过程仅使用公开的有害/安全数据集,且不改变原模型的权重。我们在三个基准上进行评估:WildJailbreak、Beavertails 和 AEGIS 2.0。实验结果显示,探针在 WildJailbreak 上的 F1 达到 99%,在 Beavertails 和 AEGIS 2.0 上分别为 83% 和 84%,性能可与体积千倍以上的外部守护模型相媲美,同时显著降低了推理时延和计算成本。

该工作表明,大语言模型的内部表征已经蕴含了对有害内容的潜在识别能力,利用轻量探针即可实现高效安全检测,为资源受限的部署提供了一条可行路径。

点评

原文链接: https://arxiv.org/abs/2609.19472

[h] 返回首页