NeFut Logo NeFut
EN 管理员登录

[AI学术] DSAgentBench:代理是否能自动化端到端数据科学工作流

发布于:2026-08-12 22:00 最后更新:2026-08-13 01:53
#AI #Machine Learning #Data Structure

最近发布的研究论文介绍了DSAgentBench,一个用于评估代理是否能自动化端到端数据科学工作流的基准测试。数据科学工作流通常需要长时间的数据处理、探索、建模、可视化和验证,并需要协调使用多种工具,如笔记本、IDE、终端、浏览器和数据库。然而,现有的基准测试缺乏对真实计算环境的评估,无法确定代理是否能执行完整的端到端数据科学工作流。DSAgentBench包含275个多样化的任务,涵盖整个数据科学生命周期,反映了实践中的复杂性和工具协调性。每个任务需要根据中间输出做出决定,并协调工具使用,包括一个确定性评估器来验证分析正确性、视觉输出和模型性能。实验结果显示,即使是最强大的代理Claude-4.6-Sonnet,也只能达到56.70%的任务成功率,而所有开源代理的成功率都低于1%,通常在工具编排、操作系统接地和多步骤推理中失败。这些结果表明,当前的代理系统与真实数据科学工作流之间存在着巨大的能力差距,DSAgentBench可以作为开发接地、可验证、自主数据科学代理的基础。博主点评: DSAgentBench为评估代理在真实数据科学工作流中的能力提供了一个重要的基准测试,揭示了当前代理系统的局限性和未来发展的方向。

原文链接: https://arxiv.org/abs/2608.10366

[h] 返回首页