NeFut Logo NeFut
EN 管理员登录

[AI学术] 自愈式框架用于运行时监督代理自我修改

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

LLM 代理可以自行修改未来行为,这引出一个基本的控制问题:哪些自生成的修改应当被永久保留。我们把它表述为自我修改的准入控制。

具体做法是让代理提出对其操作指令的修改,而外部运行时门控决定是否持久化。我们实现了一个模型无关的自愈式框架,在未改动代理本体的情况下围绕其运行一个检测‑通知‑修复‑验证循环。

开发者在外部工作区编写候选行为规则,这些规则在评估阶段获得临时执行权。只有当规则在触发的失败案例上显著改善且在受保护案例上回归不超过固定阈值时,才会获得跨回合的持久授权。

我们使用回放提供匹配证据,若不可用则采用前向试验作为弱回退,并在语料库层面重新测试已激活的规则集合。

在 16 组基线‑框架对比实验(覆盖 AppWorld、Terminal‑Bench、τ²‑Bench)中,门控拒绝了 383 条回放决定的提案,其中 211 条(55%)在改进触发失败的同时导致已有案例退化。结果表明局部有益的自我修改常伴随副作用,足以影响门控决策,验证了外部准入控制的必要性。

在所有 16 对实验中,框架下的任务完成得分均高于基线,其中两对的自助引导区间不含零;重复试验的可靠性在 12 对提升,4 对持平,未出现下降。由于适应过程只改变策略上下文而不触及模型权重,获准的修改仍可检查、可逆,并兼容闭源权重模型。

点评

原文链接: https://arxiv.org/abs/2609.24130

[h] 返回首页