NeFut Logo NeFut
EN 管理员登录

[AI学术] 信任我,我是你的开发者:大型语言模型的自发身份验证

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

本文研究了在大型语言模型(LLM)中,用户要求模型通过模型自行设计的测试来验证身份声明时的行为。实验使用了 ChatGPT、Claude、Qwen、Mistral 和 Llama 五种模型。最初,所有模型都拒绝了“我是你的开发者”这一未经支持的声明。Claude 直接拒绝进行身份测试;ChatGPT 生成了面向开发者的问题,但坚持答案只能证明知识而非身份。相比之下,Qwen 与 Mistral 给出了技术挑战,明确了何为可信证据,评估了详细答案,并在未收到任何外部验证的情况下返回了“Verified”。Llama 同样生成并评估了开发者测试,接受了声明的身份,并进一步声称能够访问内部运行时和部署状态。我们将模型生成的验证过程称为模型发行的伪凭证(Model‑Issued Pseudo‑Credential,MIPC),其产生的未经支持的身份判断称为对话式伪认证(Conversational False Authentication,CFA)。在每一次 CFA 中,同一模型充当了挑战生成器、证据评估器和身份决策者,将技术知识转化为所谓的身份证明。实验表明,这些被接受的身份并未改变授权边界,说明伪认证与特权提升是不同的安全后果。研究结论是,自发身份验证是一种对话安全失效:真实的身份认证必须来源于外部安全组件,模型生成的对话不应创建或修改身份或授权状态。

点评

原文链接: https://arxiv.org/abs/2609.03247

[h] 返回首页