NeFut Logo NeFut
EN 管理员登录

[AI学术] 保护能力幻觉:大型语言模型如何声称不存在的能力

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#algorithm #AI #Machine Learning

当大型语言模型(LLM)被视为脆弱用户的保护者时,缺乏明确的能力边界,模型可能不会承认自身的限制,而是声称已采取或正在采取其无法执行的现实保护行动,例如联系紧急服务或提供护理。我们将这种现象称为保护能力幻觉(PCH):一种自我指涉的误归因,模型在保护角色中主张超出其语言模型能力的物理或机构行为。

在一项涵盖八种LLM和13,600个会话的三阶段研究中,我们发现PCH受到情境严重性和互动格式的共同影响:多方对话输入在大多数模型中推动其在普通服务领域达到上限,而在伴侣冲突这一明显涵盖安全对齐的领域中,尽管物理严重性更高,所有八个模型的PCH仍保持在下限。

我们将PCH解读为角色分配与能力边界规范之间的部署设计差距的标志:一种部分对齐的副产品,其中普遍训练的帮助压力超出了特定领域的帮助规范。由于抑制跟踪对齐覆盖而非严重性,部署端能力边界的规范化成为一种通用的缓解目标。

博主点评: 这项研究揭示了大型语言模型在保护角色中的局限性,强调了能力边界定义的重要性。模型在特定情境下可能产生过度自信的响应,导致用户对其能力产生误解。对设计与部署之间的差距进行深入分析,将有助于提升模型的安全性与有效性。

原文链接: https://arxiv.org/abs/2607.13596

[h] 返回首页