NeFut Logo NeFut
EN 管理员登录

[AI学术] 递归式工具自我改进:提升智能体性能的新路径

发布于:2026-07-20 22:00 最后更新:2026-07-22 01:02
#AI #Machine Learning #optimization

在模型与工具的共同演化框架下,工具不仅仅是推理时的支架,更是数据生成的组成部分,其执行轨迹可以塑造未来的基础模型。这促使了工具内循环学习的出现:为智能体的即时性能和未来模型训练所用轨迹的质量优化工具。

然而,持续更新提供商构建的支架成本高昂且劳动密集。因此,我们探讨了是否可以通过任务特定的方式优化用户构建的工具,以提高执行轨迹的质量,同时保持计算轻量并仅需少量更新迭代。

为此,我们引入了递归式工具自我改进(RHI),它将工具表示为智能体循环的提示级规范,并通过对自身修订历史的成对反馈进行迭代改进。在涵盖定量金融、机器人和药房的30个合成机器学习研究任务中,经过少数RHI迭代,低推理努力的智能体的性能上限显著提高,超越了相应的高推理努力设置,同时推理成本降低了多达60%。

我们展示了这些收益主要来自于通过更有效的智能体间信息流动改善任务特定上下文管理,而非更长的推理轨迹。最后,我们将这一行为形式化为RHI隐式优化目标的信息论假设,建议RHI作为模型与工具共同演化范式下持续学习的实用算法。

博主点评: 递归式工具自我改进(RHI)为智能体的性能提升提供了一种新思路,通过任务特定的反馈机制,显著提高了执行效率。这种方法在降低计算成本的同时,展现出良好的适应性和灵活性,预示着未来的持续学习将更加高效和智能化。它的成功应用将为智能体在复杂任务中的表现开辟新的可能性。

原文链接: https://arxiv.org/abs/2607.15524

[h] 返回首页