Vision-language模型驱动的具身智能体能够根据指令完成任务,但常在执行过程中违反安全约束,这被称为交互安全。安全与任务成功是不同的目标,且安全违规只在轨迹的少数关键步骤出现,导致仅靠标准监督难以训练安全行为。模仿安全轨迹只能学习行为而不解释安全原因,对比任意安全与不安全轨迹会把安全信号与无关差异混在一起。
SafeBranch 通过环境回滚生成“分支对”。具体做法是:对每条不安全的 rollout,回滚到导致违规的关键步骤;随后让智能体在该状态下给出一个安全的备选动作;最后将原始动作与安全备选动作配对,使两条分支仅在该步骤上不同。训练后,部署时智能体无需外部 critic 即可安全行动。
在 IS‑Bench、SafetyALFRED 以及包含未见任务和物体的分布外变体上,SafeBranch 在保持任务成功率的同时显著提升安全性,在未见物体变体上实现约十倍的安全成功率,相比未训练基线表现出色。
博主点评:SafeBranch 的回滚‑配对思路巧妙地把稀疏的安全信号浓缩为可学习的对比样本,既避免了额外的安全评估模块,又保持了任务效率,值得在更复杂的具身场景中进一步验证。