在数据理解和决策能力强大的背景下,自主数据科学代理仍然过于依赖耗时的试错工作流程,这导致了昂贵的计算瓶颈。
为了解决这一问题,本文提出了数据科学世界模型的概念,该模型通过预测当前工作流状态和候选操作条件下的环境状态转移,来建模数据科学执行环境。
我们进一步提出了DSWorld,这是一个实用框架,结合了结构化状态构建、成本感知路由、轻量级真实执行和基于大语言模型(LLM)的模拟器,以处理昂贵的操作。
为了支持训练,我们构建了一个8K规模的转移轨迹数据集,并引入了反思世界模型优化(Reflective World Model Optimization),这是一种基于错误意识的强化学习策略,用于改善转移预测。
实验结果表明,DSWorld能够将基于强化学习的代理训练加速约$14\times$,而基于搜索的推理加速约$3$-$6\times$,同时保持竞争力的性能,并在转移预测任务上超越最强LLM基线35.6%。
代码可以在 DSWorld GitHub 上获取。
博主点评: DSWorld框架通过创新的数据科学世界模型,有效减少了自主代理在执行数据科学任务时的计算成本。其引入的反思世界模型优化策略和大语言模型的结合,开启了新的自动化数据处理时代,值得关注。