NeFut Logo NeFut
EN 管理员登录

[AI学术] 非平稳环境下的上下文强化学习:前沿综述

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#AI #Machine Learning #Reinforcement Learning

摘要

决策预训练变换器、算法蒸馏、长上下文元强化学习以及检索增强代理的发展,重新点燃了对上下文强化学习(ICRL)的兴趣。ICRL 是指预训练或微调的决策模型在无需测试时参数更新的情况下,从交互上下文中推断潜在任务规则并改善未来行为的能力。这项研究关注试错证据、奖励、转移、演示、反馈或检索经验何时能够在上下文窗口内实现类学习计算。

然而,现有的 ICRL 综述主要围绕预训练目标、架构、上下文格式、评估协议和理论机制进行组织,而非平稳设置却相对未被充分探讨。在变化的环境中,累积的上下文不仅是关于固定任务的更多证据:奖励规范、转移核、观察通道、动作接口、约束模型或演示和记忆分布可能与当前环境不再一致。因此,之前有用的上下文可能变得过时、误导,或者当旧环境回归时再次变得有用。

我们将非平稳 ICRL 视为在部署的策略参数保持固定的情况下,通过上下文进行适应的问题:策略必须推断当前决策规则以及其累积证据中哪些部分仍然支持该规则。我们定义了非平稳 ICRL,将其与元强化学习、决策序列建模、检索增强强化学习、价值和模型感知的 ICRL 以及奖励反馈代理相关联,并围绕三个问题组织文献:什么变化、变化如何展开以及变化对代理的可观察性如何。

博主点评: 非平稳环境下的上下文强化学习是一项前沿研究,强调了在动态环境中对上下文信息的有效利用。随着智能体在复杂环境中的应用增加,理解如何在保持策略不变的情况下适应环境变化将是未来研究的重要方向。此综述为相关领域的研究者提供了宝贵的视角与理论基础。

原文链接: https://arxiv.org/abs/2607.11906

[h] 返回首页