NeFut Logo NeFut
EN 管理员登录

[AI学术] SafeBranch:面向具身智能体的分支对安全对齐方法

发布于:2026-08-21 11:26 最后更新:2026-08-21 11:29
#algorithm #AI #Machine Learning

Vision-language模型驱动的具身智能体能够完成指令任务,但常在执行过程中违反安全约束,这被称为交互安全问题。

训练安全行为困难,因为安全与任务成功是不同目标,且安全只在轨迹中的少数关键步骤出现。传统监督不足:仅模仿安全轨迹无法解释安全原因,对比任意安全/不安全轨迹会混入无关差异。

SafeBranch框架利用环境回滚将智能体的不安全rollout回到导致违规的关键步骤,询问智能体给出安全的替代动作,并将原始动作与替代动作配对,形成仅在该步骤不同的两条分支。通过这种分支对齐,训练得到的智能体在部署时无需安全评估器即可安全行动。

在IS‑Bench、SafetyALFRED以及包含未见任务和物体的分布外变体上实验,SafeBranch在保持任务成功率的同时显著提升安全成功率,在未见物体变体上实现约十倍的安全成功提升。

博主点评:该方法巧妙利用回滚生成对齐数据,解决了安全信号稀疏的问题,展示了在真实环境中提升安全性的可行路径。

原文链接: https://arxiv.org/abs/2608.19729

[h] 返回首页