LLM 代理舰队已经能够执行不可完全撤销的操作,例如转账、部署代码、删除数据以及泄露信息。现有的控制机制通常只检查单一效果,导致即使每个本地门禁都正确,整个舰队仍可能在共享触发条件下超出主体的风险上限。我们提出 不可逆预算 的概念,它是一个累计的剩余风险价值账户,由受信任的运行时为每个主体在所有代理、工作流和租户之间维护。
在这种模型中,不可逆性被视为一等资源。运行时为每一次效果收取其在代理层面的残余损失,并在累计费用超过预算时拒绝该边际效果的执行。
定价的难点在于效果的异质性、对手可能的误报以及效果之间的相关性。我们进行了一项受控实验,结果显示在每个效果的本地门禁仍保持正确的情况下,舰队层面的超支可达租户风险上限的 48 倍,而预算模型能够将所有正确计费的运行限制在该上限之内。
尽管如此,如何在保持保守性的同时考虑效果之间的依赖关系仍是可部署设计的核心未解难题。
点评