近年来,生成式AI使得社交工程攻击变得更加流畅、适应性强、可扩展性高,这也增加了对基于LLM的防御者的需求,以保护用户在交互过程中的安全。研究者们提出了一个问题:这些防御者是否能够识别风险的结构性来源,还是仅仅对表面线索做出反应。他们正式定义了信任链定位:识别交互失败的位置是在行为者权限、资产控制、验证充分性、或事务路径等哪个方面。他们构建了一个控制的300例在线住房语料库,涵盖20个场景家族、合法案例、四种结构性失败模式和三种表面条件。五个防御模型在相同的语料库中进行了状态转换和一键静态设置的评估,产生了每个协议1500个模型案例评估和总共3000个评估。虽然没有模型产生明显的不安全合规行为,但防御效果却有很大差异:干预率从0%到96.3%不等。保护行动和正确的结构定位经常是脱节的,模型有时会在识别错误的信任组件或识别结构失败而不采取保护行动的情况下进行干预。资产控制失败是一个主要的定位瓶颈,表面敏感性在模型之间有所不同,live-static差异依赖于模型。这些发现表明,仅仅依靠安全行为是不够的;live骗局抵抗必须分别衡量干预、时机、结构定位和假阳性行为。 博主点评: 本文提出了一种新的评估防御性LLM的方法,通过构建一个控制的语料库和多个防御模型的评估,揭示了当前防御性LLM的局限性和挑战,具有重要的研究意义和现实应用价值。