摘要
代理安全的关注点正在从内容审核转向在工具使用代理行动之前预防操作失败。我们提出了Janus,这是一个面向前瞻性的长期代理安全框架,旨在训练守卫预测来自部分轨迹的延迟风险。
Janus通过多代理仿真综合多样的代理轨迹,并学习一个共享策略,包含两个耦合任务:一个是预测任务,负责预测与安全相关的未来情况;另一个是裁决任务,决定基于已观察的前缀和预期的未来情况来判断安全。这两个任务通过CoAA-RL进行联合优化,该方法通过其对下游安全判断的效用来奖励预测。
最终生成的守卫模型Vanguard,在执行之前能够阻止不安全的行为。在四个代理安全基准测试中,Vanguard相比于基线守卫提高了15.9个百分点的平均保护率,同时提高了5.1个百分点的良性任务完成率。
博主点评: Janus框架通过多任务学习有效提升了代理安全性,特别是在长时间跨度的情景下,具有重要的实际应用价值。Vanguard模型的成功展示了前瞻性预测在强化学习中的潜力,值得进一步研究和应用。