NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越批准操作:Agent 工作流中持久结果的运行时验证

发布于:2026-09-30 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

大型语言模型(LLM)代理正从单纯生成文本转向直接操作软件系统,包括修改数据库和调用在线服务。即使一次数据库更新已获批准,执行过程仍可能产生未获批准的通知或其他持久副作用,这些副作用会在后续步骤中被误认为成功并继续传播。现有的安全机制只能在动作执行后记录结果,或在提交前检查单一动作,却缺乏对整个执行边界内所有持久变化的统一校验。

为了解决此问题,我们提出 EffectMatch,一种在受控执行边界内收集所有持久更改并与应用层批准的状态进行比对的运行时框架。EffectMatch 的核心流程包括:① 在执行期间拦截并记录所有对外部持久状态的写入;② 将这些记录与当前状态下应用所批准的变更集合进行匹配;③ 仅在匹配成功时提交(commit)并允许后续依赖步骤继续执行,否则阻止提交并中止后续流程。该机制确保任何未获批准的持久结果都不会被静默接受或向下游传播。

我们在 206 项公开业务任务上进行对比实验,结果显示:EffectMatch 能完整保留所有正确执行的任务,同时阻止了所有被检测出的错误提交。进一步的 6 组 20 次运行的消融实验表明,去除任一关键机制(如边界拦截、状态比对或提交控制)都会导致相应的失败。额外的 80 组任务拓扑测试验证了 EffectMatch 能在真实的任务交接场景中保持合法的交接并阻断无效的后续执行。

这些实验表明,EffectMatch 有效防止了持久结果与应用批准不一致时的静默接受,并阻止了错误结果在工作流中的向下传播。

点评

原文链接: https://arxiv.org/abs/2609.31301

[h] 返回首页