ToolVerse是一个全面的框架,旨在扩展代理强化学习(RL)环境,使得智能体能够在工具集成推理(TIR)任务中执行复杂的长远推理。
首先,ToolVerse自动构建来自近400个真实世界模型上下文协议(MCP)的可执行大型代理训练环境,这些协议包含约4500个工具。
其次,我们提出了一种基于工具依赖图的任务设计策略,利用动态解锁采样算法(Dynamic Unlocking Sampling Algorithm)生成长远任务,并生成GUST(图解锁采样任务)数据集。
最后,为了缓解长远代理强化学习中的信用分配问题,我们提出了一种细粒度的转向感知相对优势算法(Turn-Aware Relative Advantage)。
通过使用ToolVerse进行广泛的代理强化学习训练,并在多个代理基准上评估我们的框架,实验结果表明,我们的框架显著增强了大型语言模型(LLM)在动态环境中长远工具使用的能力,实现了显著的性能提升,并展示了在复杂环境中的稳健推理能力。
博主点评: ToolVerse的引入为智能体在复杂环境中的工具使用提供了新的解决方案,通过构建庞大的训练环境和创新的任务设计策略,显著提升了智能体的推理能力。这种框架的有效性表明,未来在真实世界应用中,强化学习的潜力将得到更好地挖掘与实现。