工具型语言模型代理在调度器、数据管道、对象存储和访问控制系统中频繁写入。读取与提交之间的外部状态可能被并发修改,但并非所有修改都会导致提交不安全。我们将破坏安全谓词的竞争称为无效竞争,将保持谓词或无关的竞争分别记为保留竞争和无关竞争,并探讨运行时守护如何精确地区分它们。
我们的确定性模拟器把可见状态与权威状态分离,在四个领域的十六项基础设施任务中注入五种非原子失效机制。冻结的代理提案在每个控制器下进行反事实回放,且不使用 LLM 判决。
实验在三种本地量化模型(Qwen3‑4B、Phi‑4‑mini、Gemma4‑8B)上运行 3456 条轨迹,评估三种提交时守护粒度:全局 epoch、读集版本和语义提交谓词,并结合多层验证和模型侧门控。
结果显示,三种守护均能消除不安全提交。基于新鲜度的守护误阻 92‑95% 的良性竞争,导致最多 43% 的安全任务被放弃;而完整谓词守护不阻止任何安全提交。精度依赖于合同细节:删除单条声明条款会使对应的故障族全部转为不安全(最高 7.9%)。模型侧信号无法替代:口头置信度校准差(ECE≈0.37),动作一致性等同随机门,警示提示对直接不安全率影响不大,且在新鲜度守护阻止后,代理仍会在读取仍不完整的情况下重新提交导致不安全。降级遥测下隐藏的并发变更仍保持观测清洁,限制了所有选择性策略。因而精确的运行时强制需要语义合同,而非新鲜度启发式或模型自评。
点评