随着大语言模型(LLM)逐步演化为能够影响真实世界状态的自主代理,确保多步骤工作流的运行安全成为关键挑战。已有研究已从单轮评估转向多轮范式,但仍存在两大局限:
- 步骤级方法将每个动作孤立处理,忽视风险的累积效应;
- 轨迹级评估在事后进行,无法提供及时干预的机会。
为克服这些缺陷,本文提出解耦主动安全监控的三维框架:是否干预、何时干预以及风险是什么。基于此框架,构建了 PASTABench 基准,收录 1,139 条多轮轨迹,覆盖 5 大风险类别和 13 个子类别。
我们进一步定义 最优干预窗口(Optimal Intervention Window, OIW),通过标注的最早信号(Earliest‑Signal)和触发点(Trigger)回合来量化干预的时效性。对 16 种 LLM 进行评测发现,主动干预仍未得到有效解决,最佳模型的最优时机干预率仅为 40.74%。细粒度诊断揭示了普遍的词汇过拟合现象:小模型凭借关键词敏感性获得竞争性安全得分,但在危害词汇被中和后,其主动能力几乎崩溃,表明其并未真正理解风险。
点评:PASTABench 为评估 LLM 主动安全提供了系统化基准和时效度量,揭示了当前模型在风险感知与干预时机上的根本不足,为后续研究指明了改进方向。