NeFut Logo NeFut
EN 管理员登录

[AI学术] 如何实现安全运行时保障?工具使用代理的理论探讨

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#algorithm #optimization #C++

摘要

运行时保护措施在不可逆工具调用之前起作用,但其保障程度依赖于可表示的策略状态、观察者的判断以及干预是否改变未来行为。我们将问题分为三个部分。

首先,针对固定的预言者谓词,确定性门控机制只强制执行其寄存器模型所识别的非空安全策略的前缀;而策略的非平凡性在两个可递减计数器的情况下是不可判定的,但在可分离单调片段中是 PSPACE 可解的。

其次,在固定的外部法律下,Neyman-Pearson 定理给出了准确的假阻塞/漏失边界,符合校准提供了有限样本的边际证明,可能通过阻塞所有方法实现。

第三,一旦阻塞改变了未来的提案,静态评分和未门控轨迹不必识别闭环边界;而是指定的有限控制模型得以产生一个占用程序。受限的表示攻击增加了鲁棒性边际,因此,仅依靠良性校准是无法转移的。

实验通过静态诊断、控制模型枚举、表示重写和配对闭环重跑来针对这些区别进行验证。

博主点评: 本文深入探讨了工具使用代理的运行时安全性理论,提出了多个关键的技术概念,如确定性门控和Neyman-Pearson定理,强调了策略的复杂性和鲁棒性的重要性,展示了理论与实验的结合。

原文链接: https://arxiv.org/abs/2607.22868

[h] 返回首页