NeFut Logo NeFut
EN 管理员登录

[AI学术] 批准太迟:LLM 保护的自适应系统中的判决陈旧性

发布于:2026-08-29 22:00 最后更新:2026-08-30 12:07
#AI #Machine Learning #LLM

在自适应系统 (SAS) 中,使用大语言模型 (LLM) 作为安全护栏时,护栏可能在检查时给出正确的批准,但在实际执行时已变得陈旧,这会导致检查‑使用时序 (TOCTOU) 风险。本文聚焦 判决新鲜度:即护栏的批准在被使用时是否仍然有效。

我们区分了三类新鲜度度量:

  1. 全候选判决变化率:在固定动作回放下,所有可能的批准在不同时间点是否会改变;
  2. Oracle 标记的批准失效率:在记录的闭环轨迹上,标记哪些批准已过期;
  3. 判官条件的使用时失效率:考虑不同 LLM 判官的判断,评估批准在使用时是否失效。

在五个可复现的 SAS 环境中,使用统一的回放偏移(八个仿真步)时,全候选判决变化率介于 5.3%‑48.4%。为此我们提出 新鲜度受限护盾 (Freshness‑Bounded Shield, FBS),它通过安全边际和最近特征波动估算每个批准的有效时限,无需显式的植物动力学模型。

在相同的回放偏移下,FBS 将 Oracle 标记的批准失效率从 3.4%‑24.7% 降至 0‑1.8%。进一步审计四个不同的 LLM 判官发现,每条批准流中均出现非零的判官条件使用时失效。

基于实验结果,我们提出 新鲜度合约:每一次批准必须在检查时正确,并在使用时仍保持有效。

博主点评: 这篇工作揭示了 LLM 作为安全护栏时的时效性盲点,并提供了无需模型的轻量化解决方案,对实际部署具有重要参考价值。

原文链接: https://arxiv.org/abs/2608.26306

[h] 返回首页