NeFut Logo NeFut
EN 管理员登录

[AI学术] 自我发现的强化学习:学习历史是资产还是负担?

发布于:2026-09-30 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

本文聚焦于递归自我改进(RSI)在通用智能中的实现路径,比较宏观的语言模型规模扩展与“经验时代”的交互驱动原则。无论宏观路线如何,最终都依赖底层的强化学习(RL)更新机制能够进行累积适应。近期算法自发现产生了 Disco103,超越 PPO 达到 SOTA 基准,但其内部更新过程仍是黑箱。

我们对自发现的 RL 规则进行首次因果机制审计,围绕“经验时代”的五大支柱:扩展视野、基于真实的奖励尺度、持续数据流、生命周期内的变化以及探索深度。审计手段是对循环状态进行定位、冻结或迁移,同时保持元参数不变,从而检验学习历史何时是资产、何时是负担。

审计得到三条关键结论:

  1. 循环历史显著扩展可用奖励尺度,使有效窗口从零固定时的 3 个十年提升至 6 个十年;
  2. 将历史内容与其维护解耦后发现,历史不匹配的惩罚主要来源于持续的钳制;若允许导入的状态自然演化,这一负担会减弱;
  3. 在环境变化下,控制回放保留会逆转相对于 DQN 的适应优势,表明外部数据的更替会混淆内部可塑性。

这些发现通过能力阈值验证,并成功迁移到第二条规则(OPEN),为宏观 RSI 目标提供了微观学习动力学的实证依据,也为下一代自演化 RL 算法设立了审计标准。

点评

原文链接: https://arxiv.org/abs/2609.35897

[h] 返回首页