NeFut Logo NeFut
EN 管理员登录

[AI学术] 闭环知识动态:突破饱和与逃逸的操作框架

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #optimization #Reinforcement Learning

在大语言模型、强化学习和自主发现中,反馈驱动的循环支持迭代改进,但在重复的内部反馈下,其收益往往会减弱。我们研究了闭环知识系统饱和的原因,以及什么外部信息能够使它们超越当前的吸引子。

我们引入了一个三级操作框架,其中知识状态 $x_t$ 通过由结构参数 $\theta$ 索引的转移核 $K_{\theta}$ 进行演变。治理结构被定义为由这些核诱导的 $\theta$ 的观测等价类,而吸引子和基线是固定-$\theta$ 动力学的属性。

结构干预改变 $\theta$ 并在预设的探测状态上产生可检测的核差异,使结构变化可被证伪。通过使用 Lyapunov 漂移条件,我们表明稳定的内部动力学接近有界稳定区域,其瞬态以指数方式衰减,并具有噪声控制的残余底线。

我们通过干预引起的吸引子位移的度量条件和相对于基线的 KL 下界表征逃逸概率的增加。该分析还解释了为什么仅仅依靠条件互信息无法认证逃逸:它测量的是干预条件更新之间的变化,而不是脱离无干预法则的程度。

在 LLM 代码修复、稀疏奖励强化学习和贝叶斯优化的案例研究中,使用匹配的延续控制来说明反馈强度和一致性如何影响质量改善的逃逸。我们的贡献在于建立了稳定性工具、可测量的干预效果和跨领域诊断之间的操作性联系。

博主点评: 本文提出的闭环知识动态框架为理解知识系统的饱和与逃逸提供了新的视角,尤其在大语言模型和强化学习领域。通过结构干预和可测量的效果,研究者能够更好地优化模型性能,值得关注的是如何在实际应用中实现这些理论成果。

原文链接: https://arxiv.org/abs/2607.14185

[h] 返回首页