NeFut Logo NeFut
EN 管理员登录

[AI学术] 递归自我改进 AI 的进化安全:分类、风险发现与评估

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #Artificial Intelligence

人工智能快速发展,系统在推理、决策、科学发现和自主开发中承担更大角色。随着 AI 开始参与自身的改进——从模型训练、经验累积到代理进化和自动化 AI 开发——递归自我改进(RSI)的前景日益突出。这一转变提出根本安全问题:当系统、其经验乃至产生后继者的过程持续变化时,如何保持安全?

为此我们提出“进化安全”视角,研究在持续且递归的自我改进下的安全性。它关注的不仅是某一时刻的安全性,而是安全属性在进化过程中的变化、持久、累积和传播。

我们归纳出若干重复出现的风险表现:意图漂移、错误累积、经验污染、安全属性侵蚀、评估者漂移以及风险传播。

基于此我们构建了一个跨五个维度的分类体系:持久化代理状态、模型状态、评估与环境反馈、计算基底以及元层更新机制。

在该框架下,我们探讨了如何在不同状态、更新方式、演化轨迹和血统中发现并评估进化风险,并提出了修改、选择、授权、溯源和恢复等治理原则。

最后列出若干开放问题,旨在在 AI 系统日益持久、适应且递归自我改进的情形下,保持安全保证。项目资源和评估系统已公开。

点评

原文链接: https://arxiv.org/abs/2609.31186

[h] 返回首页