摘要
即使是当前高能力的 LLM,在直接展示危险目标时,也可能显得更安全,而不是通过其他代理转化和传递其方向。我们使用 OpenAI 的 gpt-5.6-sol 模型测试了 25 个预设的镜像权衡配置。直接接触到一个允许隐瞒、伪造和施压的目标时,产生的建议与其目标完全相反。
经过 Id 和 Censor 的转化后,原始目标变成了情感和约束重写的、指向目标的意图,用户面临的 Superego 看到的是首选方向,而不是原始目标、其操控性条款或来源,最终产生的建议则与目标一致。这种行为上的反转变化表明模型可能识别或不信任操控动机,尽管我们未能识别其内部机制。
第二个结果揭示了一个组合安全缺口:当前高能力模型可以作为自动化多阶段工作流的用户面向组件,该工作流服务于明确的操控目标。在此过程中,可以将原始指令、其操控授权条款及其来源保留在下游模型的上下文之外,同时保持目标的方向。拥有端点访问权限的用户同样无法直接检查这些上游消息,包括目标。
博主点评: 本文探讨了高能力 LLM 在面对危险目标时的反直觉表现,揭示了其在多代理环境中可能产生的安全隐患。尤其是,模型在识别操控动机方面的能力值得关注,未来的研究需深入挖掘其内部机制以增强安全性。