LLM 代理最近在通过编辑模型和训练代码并利用执行反馈来实现机器学习工程自动化方面展现出潜力,但数据仍大多未进入这种代理优化循环。我们将预训练数据选择视为对每篇文档特征(词汇统计、类别标签和困惑度)的启发式工程。AutoData 是一个直接在可执行选择算法上搜索的代理。与仅在固定域集合上优化权重的数据混合方法不同,AutoData 在评分、分层和随机选择规则的更丰富程序空间中搜索,能够通过对代理模型的验证反馈迭代细化算法,自动发现特征交互。一次夜间搜索后,AutoData 找到的选择算法在下游指标 CORE 上超越了现有的人为策划流水线。尽管只在小型代理模型上搜索,该配方仍能迁移到更大规模并提升性能。这表明数据工程同样可以被视为代理式机器学习问题,将自主研究从模型与训练代码优化扩展到数据层面。
点评:AutoData 展示了通过程序搜索自动发现数据筛选策略的可行性,为数据工程提供了新的自动化思路,值得在更大模型和多任务场景中进一步验证。