NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破环境壁垒:递归自我改进的LLM代理环境演进

发布于:2026-09-26 22:00 最后更新:2026-09-28 00:49
#Machine Learning #LLM #Artificial Intelligence

许多真实任务需要LLM代理反复与环境交互,但现有环境存在三大障碍:信息碎片化、证据混杂误导、环境随时间演化引入噪声。这些问题导致最先进的AI代理性能大幅下降,例如准确率从83.9%跌至57.6%。

为此提出Env‑Rethink,基于27B后训练模型,提供三项核心能力。其一,动态构建Collection Map用于聚合相关文件,生成Event Log以捕获跨数据的上下文关联,从而补全缺失的环境信息。其二,利用离线轨迹学习让后训练模型识别环境中的噪声根源。其三,通过虚拟事件历史修改环境状态和证据关系,生成更具挑战性的环境,推动代理的递归自我改进。

实验在30个任务上覆盖9种模型,Env‑Rethink使通过率提升15.1个百分点,验证了其在提升下游任务表现方面的有效性。

点评

原文链接: https://arxiv.org/abs/2609.29773

[h] 返回首页