摘要
工具使用代理通常会附带自由格式的推理内容,但这些推理既不是授权也不是可靠的内省。我们提出了解释性工具执行(EBTE),这是一种带有声明的中介层,将与决策相关的推理内容转换为类型化的行动声明,并根据服务器持有的意图、政策、负载、工具、风险、来源和新鲜度等事实进行检查。EBTE不能扩大基本权限:冲突会被拒绝,不完整或不确定的声明会被审查,只有匹配的声明才有资格进行受控执行。
我们在明确的中介和可信事实假设下对该组合进行了形式化,并实现了一个版本化的参考配置文件,尽量减小审计数据包。在136个编写的符合性场景中,完整配置文件匹配所有指定的处置,未接受96个指定的硬性矛盾,并通过232个变形检查;这些结果验证了所包含配置文件的有效性,而非人口性能。草案参考集成未在EBTE下转发48个编写的硬性案例,同时保留所有16个软审查和4个对齐草案路径。
在2026年7月12日的冻结探索性224次尝试托管模型记录中,历史生成/运行者协议计数分别为71/96、66/96和19/32;对当前管道下保留的最小化声明进行的单独标记零调用后验证,结果为70/96、65/96和17/32。在基于AgentDojo的语义检查中,现有的高风险控制已使所有12个攻击提案被拒绝;EBTE进一步将其判定为拒绝。这些结果支持了服务器检查的行动声明的可行性和诊断价值,而不是推理的可信性、人类审查的益处、代表性攻击抵抗或生产安全性。
博主点评: EBTE机制的提出为AI代理的执行安全性提供了一种新思路,通过引入严格的声明审查与服务器验证,显著提升了工具使用过程中的信任度。这种方法不仅确保了行动的合规性,还有效地防止了潜在的安全风险,值得在更广泛的应用场景中推广和验证。