摘要
数据科学任务涵盖从封闭式信息提取到开放式分析,面临显著的自动化挑战。近期,由语言模型驱动的AI代理在处理此类复杂任务时展现出潜力。然而,现有代理通常依赖于单一的初始状态,这一状态决定了整个代理的执行,导致其易受初始状态不佳引发的级联错误影响。
为了解决这一问题,我们提出了CIPHER,一个通过生成和选择多个初始状态以并行执行的自动化数据科学代理。
CIPHER与现有的AI代理测试时间扩展工作不同,它明确将候选初始状态的生成与其战略选择解耦。通过对两个基准(封闭式与开放式任务)的广泛评估,我们证明CIPHER在匹配模型比较中超越了当前最先进的性能,并且在依赖于显著较小的基础语言模型的情况下,仍然与更大模型的基线保持竞争力。
我们的实证研究刻画了解耦探索-选择(DES)框架的设计空间:我们量化了生成策略、选择策略和聚合模型容量如何影响整体性能,并为从业者提供了可行的设计建议。
博主点评: CIPHER的创新在于通过解耦策略有效克服了传统模型在初始状态选择上的局限,为数据科学代理的自动化提供了新的思路。其在多个基准上的出色表现,显示了模型设计与策略选择的重要性,值得关注和深入研究。