人工智能快速发展,系统在推理、决策、科学发现和自主开发中承担更大角色。随着 AI 开始参与自身的改进——从模型训练、经验累积到代理进化和自动化 AI 开发——递归自我改进(RSI)的前景日益突出。这一转变提出根本安全问题:当系统、其经验乃至产生后继者的过程持续变化时,如何保持安全?
为此我们提出“进化安全”视角,研究在持续且递归的自我改进下的安全性。它关注的不仅是某一时刻的安全性,而是安全属性在进化过程中的变化、持久、累积和传播。
我们归纳出若干重复出现的风险表现:意图漂移、错误累积、经验污染、安全属性侵蚀、评估者漂移以及风险传播。
基于此我们构建了一个跨五个维度的分类体系:持久化代理状态、模型状态、评估与环境反馈、计算基底以及元层更新机制。
在该框架下,我们探讨了如何在不同状态、更新方式、演化轨迹和血统中发现并评估进化风险,并提出了修改、选择、授权、溯源和恢复等治理原则。
最后列出若干开放问题,旨在在 AI 系统日益持久、适应且递归自我改进的情形下,保持安全保证。项目资源和评估系统已公开。
点评