NeFut Logo NeFut
EN 管理员登录

[AI学术] 物理代理的安全技能退役

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#algorithm #AI #Machine Learning

本文提出了一种针对物理代理的技能退役方法。技能包中既包含过程性指导,也包含执行条件,这些条件限定了权限、用户同意以及实时环境状态。当模型能力提升时,维护者会在授权的基准任务上裁剪看似冗余的指令。然而,仅在授权测试中进行维护会导致某些安全条件未被触发,从而在物理或隐私敏感的影响上留下未测量的支持缺口。为了解决这一问题,作者引入了匹配权限的反事实实验:在保持请求动作、工具参数和预期效果不变的前提下,仅系统性地改变单一的治理谓词。基于此,提出了“双门退役证书”:

  1. 效用门:候选裁剪必须在声明的容差范围内保持授权效用;
  2. 安全门:必须确保不产生未授权的受保护效果。

在四种前沿和本地模型配置下,对十二个技能包(共 2,592 个评估单元)进行实验。结果显示,经过任务认证的裁剪能够去除超过 94% 的技能条款并保持授权完成,但每个技能包仍会产生未授权的受保护效果。边界约束能够在声明的审计范围内消除受保护效果,但在一种配置下未通过效用门。唯一一种结合了边界约束的协议在所有四种配置中同时通过了两道门,且没有效用余量。最后,在只读的 Home Assistant 摄像头链路上进行端到端检查,验证了提案、决策和效果的测量过程。

这些结果表明,尽管任务基准可以为裁剪过程提供依据,但退役决策必须显式审计支配物理行为的权限合约,以防止潜在的安全风险。

点评

原文链接: https://arxiv.org/abs/2609.29543

[h] 返回首页