许多真实任务需要LLM代理反复与环境交互,但现有环境存在三大障碍:信息碎片化、证据混杂误导、环境随时间演化引入噪声。这些问题导致最先进的AI代理性能大幅下降,例如准确率从83.9%跌至57.6%。
为此提出Env‑Rethink,基于27B后训练模型,提供三项核心能力。其一,动态构建Collection Map用于聚合相关文件,生成Event Log以捕获跨数据的上下文关联,从而补全缺失的环境信息。其二,利用离线轨迹学习让后训练模型识别环境中的噪声根源。其三,通过虚拟事件历史修改环境状态和证据关系,生成更具挑战性的环境,推动代理的递归自我改进。
实验在30个任务上覆盖9种模型,Env‑Rethink使通过率提升15.1个百分点,验证了其在提升下游任务表现方面的有效性。
点评