大型语言模型(LLM)代理在自动化数据科学工作流方面展现出潜力,但其整体表现高度依赖于任务表示、执行状态管理、输出约束和评估反馈等代理框架(harness)。现有的代理往往把这些框架隐式处理,导致不同任务之间的结果难以复现、对比和归因。
DS‑Lighting 提出了一套统一的框架工具包,将代理框架显式划分为四个可复用层:数据层、工作流层、执行层和评估层。每个层都提供标准化的接口,使得各种代理可以被编译为可执行的算子程序(operator program),既支持预定义的流水线,也支持基于搜索的自适应策略。
此外,DS‑Lighting 将多个开源数据科学基准整合为 MLE‑Bench 风格的任务格式,统一任务接口、沙箱运行时和度量协议,从而在同一平台上进行受控比较。
实验在不同代理、框架配置、模型以及消融设置下进行。结果表明,显式的框架设计显著提升了工作流的可复现性、可比性和可靠性,同时显著降低了系统层面的失败率。代码已开源于 https://github.com/usail-hkust/dslighting。
点评