NeFut Logo NeFut
EN 管理员登录

[AI学术] 自我改进系统的可证伪发布门控机制

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#algorithm #C++ #Open Source

在自我改进代理的运行时安全声明中,几乎所有的评估都是自我评分的:如策略文件、护栏或承诺说明。我们提出了一种可证伪发布门控机制及其构建与验证的方法论,确保每个新功能在发布前必须通过预设的、可机器验证的接受测试套件,并在每个门控处保持一组固定的不变性。我们在 Antahkarana(一种开源运行时)中应用了该方法,通过七个门控从基本可观察性到自我治理循环,建议对其政策进行更改。任何行动在没有由控制环铸造的安全关键属性能力令牌的情况下都无法传递给执行器,这一过程在一百万个记录的可达状态空间中经过彻底的机器检查,并根据执行轨迹重新检查。故意破坏的模型提供了最短的反例,使得检查器具有实质性作用。自我增强循环是积极受限的:整个写入表面是政策规则,收紧的更改可能会自动应用,而放松的更改始终需要人工合并。一个错误预测自身效果的提案会被自动关闭。我们发布了所有七个门控的接受测量结果,精确定义了每个声明的范围(协调框架的边界,而不是学习的组件),并释放运行时工具和门控套件,以便结果可复现,门控可以在其他代理框架中运行。审稿人可以在几秒钟内重复执行单一命令的非旁路操作。

博主点评: 本文提出的可证伪发布门控机制为自我改进系统的安全性提供了一个新视角,尤其适用于需要严格控制变更的场景。通过机器验证的接受测试和不变性检查,显著提升了系统的可靠性和可控性,尤其在复杂的自我改进环境中,值得深入研究和应用。

原文链接: https://arxiv.org/abs/2607.13070

[h] 返回首页