大型语言模型(LLM)在高风险场景中的使用日益增多,但其生成有毒、危害或违背政策的内容的倾向带来了安全隐患。如何在黑盒条件下高效检测这些不安全输出仍是未解难题。本文在近期提出的用于幻觉检测的动力系统框架基础上,扩展至LLM安全分类。我们将提示(prompt)和响应(response)分别映射到高维嵌入空间,并为安全和不安全两种状态分别拟合 Koopman 预测模型。对新输出的判别采用差分残差分数(differential residual score),即比较安全模型与不安全模型的预测误差。关键创新在于同时建模提示与响应的嵌入动力学,从而得到捕捉交互模式的 Koopman 算子。实验在三个安全基准上使用三种嵌入模型进行评估。结果表明,加入提示嵌入能够持续提升性能,尤其在交互依赖的违规场景(如 Llama‑3 的因果解码器)中表现突出;而仅响应的违规更依赖密集语义嵌入的表达能力。这些发现表明,动力系统方法可以用于分析 AI 系统本身,而非传统的“用 AI 去建模动力系统”。
博主点评:该工作巧妙地将 Koopman 动力学引入 LLM 安全检测,展示了提示‑响应交互信息的重要性,为黑盒安全评估提供了新思路。未来可进一步探索更复杂的嵌入结构和实时检测的可行性。