NeFut Logo NeFut
EN 管理员登录

[AI学术] 语言安全背后的物理危险:揭示隐藏状态风险空间中的真实威胁

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#algorithm #AI #Machine Learning

摘要

大型语言模型(LLMs)越来越多地作为具身体代理的高级规划工具,其中看似无害的语言指令在真实世界中可能变得不安全。我们研究了这种物理基础的危险是否与普通文本级内容危险相同。

通过隐藏状态方向分析和随机分割零假设测试,我们展示了内容危险(CD)和物理危险(PD)在LLM表示中是可分的信号,适用于Qwen2.5-3B/7B/14B/32B、Phi-3.5和SmolLM2。

基于CD/PD的可分性,我们提出了PRISM,这是一个在全部隐藏状态上进行L2正则化的单层逻辑探测器。PRISM在SafeAgentBench上实现了86.2%至87.7%的准确率和11.7%至13.7%的假阳性率,而同规模的LLM在评估安全任务时假阳性率为24.7%至39.0%。

我们进一步引入了PhysicalSafetyBench-1K (PSB-1K),这是一个包含1,000个物理风险对的对比基准,且不包含直接的危害关键词,以测试方法是否能探测到物理基础的危险,而非仅仅是明确的不安全措辞。在PSB-1K上,PRISM达到了99.6%的准确率和0.7%的假阳性率,而Qwen2.5-3B的检测器则拒绝了67.8%的安全任务。PRISM在SafeText和EARBench上的复制实验进一步支持了隐藏状态探测作为超越文本审查的物理安全表示级方法。

博主点评: 本文通过深入分析隐藏状态,揭示了语言模型在物理世界中潜在的安全隐患,提出的PRISM方法在检测物理危险方面表现出色,具有重要的应用前景,值得进一步探讨其在实际场景中的适用性和准确性。

原文链接: https://arxiv.org/abs/2607.15218

[h] 返回首页