在训练API调用的大型语言模型(LLM)智能体时,往往需要大量高质量的轨迹数据。然而,收集这种数据通常需要实现完整的环境,包括可执行的API和预填充的后端数据库,这成为了扩展性的一大瓶颈。
为了解决这一问题,我们提出了一种无环境的合成数据生成方法,利用LLM作为实时数字世界模型。
该方法仅依赖API规范生成模拟智能体与状态环境之间交互的轨迹。具体而言,LLM首先生成可由提供的API解决的多样化任务。然后,教师智能体迭代解决每个任务,同时LLM模拟器根据任务上下文和模拟历史生成一致的合成API响应。最后,LLM评判者过滤轨迹,以确保生成数据集的质量。
我们在具有挑战性的AppWorld和OfficeBench基准上评估了我们的方法,这些基准包括信息检索和状态改变任务。对我们的合成数据进行微调的模型显示出显著的性能提升,证明了在没有任何可执行环境的情况下,可以生成有效的API调用智能体的监督数据。
我们的结果确立了基于LLM的API模拟作为一种实用且可扩展的解决方案,以训练跨多种API生态系统的智能体。
博主点评: 这项研究通过引入无环境的合成数据生成方法,显著降低了训练API调用智能体的门槛。利用LLM生成模拟数据的创新思路,不仅提高了数据生成的效率,也为智能体在多种API环境中的应用提供了新的可能性,值得关注和深入研究。