在自适应系统 (SAS) 中,使用大语言模型 (LLM) 作为安全护栏时,护栏可能在检查时给出正确的批准,但在实际执行时已变得陈旧,这会导致检查‑使用时序 (TOCTOU) 风险。本文聚焦 判决新鲜度:即护栏的批准在被使用时是否仍然有效。
我们区分了三类新鲜度度量:
- 全候选判决变化率:在固定动作回放下,所有可能的批准在不同时间点是否会改变;
- Oracle 标记的批准失效率:在记录的闭环轨迹上,标记哪些批准已过期;
- 判官条件的使用时失效率:考虑不同 LLM 判官的判断,评估批准在使用时是否失效。
在五个可复现的 SAS 环境中,使用统一的回放偏移(八个仿真步)时,全候选判决变化率介于 5.3%‑48.4%。为此我们提出 新鲜度受限护盾 (Freshness‑Bounded Shield, FBS),它通过安全边际和最近特征波动估算每个批准的有效时限,无需显式的植物动力学模型。
在相同的回放偏移下,FBS 将 Oracle 标记的批准失效率从 3.4%‑24.7% 降至 0‑1.8%。进一步审计四个不同的 LLM 判官发现,每条批准流中均出现非零的判官条件使用时失效。
基于实验结果,我们提出 新鲜度合约:每一次批准必须在检查时正确,并在使用时仍保持有效。
博主点评: 这篇工作揭示了 LLM 作为安全护栏时的时效性盲点,并提供了无需模型的轻量化解决方案,对实际部署具有重要参考价值。