NeFut Logo NeFut
EN 管理员登录

[AI学术] PASTABench:面向代理安全的主动序列轨迹评估

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

随着大语言模型(LLM)逐步演化为能够影响真实世界状态的自主代理,确保多步骤工作流的运行安全成为关键挑战。已有研究已从单轮评估转向多轮范式,但仍存在两大局限:

为克服这些缺陷,本文提出解耦主动安全监控的三维框架:是否干预、何时干预以及风险是什么。基于此框架,构建了 PASTABench 基准,收录 1,139 条多轮轨迹,覆盖 5 大风险类别和 13 个子类别。

我们进一步定义 最优干预窗口(Optimal Intervention Window, OIW),通过标注的最早信号(Earliest‑Signal)和触发点(Trigger)回合来量化干预的时效性。对 16 种 LLM 进行评测发现,主动干预仍未得到有效解决,最佳模型的最优时机干预率仅为 40.74%。细粒度诊断揭示了普遍的词汇过拟合现象:小模型凭借关键词敏感性获得竞争性安全得分,但在危害词汇被中和后,其主动能力几乎崩溃,表明其并未真正理解风险。

点评:PASTABench 为评估 LLM 主动安全提供了系统化基准和时效度量,揭示了当前模型在风险感知与干预时机上的根本不足,为后续研究指明了改进方向。

原文链接: https://arxiv.org/abs/2609.28197

[h] 返回首页