大型语言模型(LLM)代理能够提出、实现并评估模型改动。通过分钟级的自包含程序循环展示了这种能力,这类循环称为自动研究(autoresearch)循环。在线自动研究则跨越异步系统、数小时的变体以及数周的活动,甚至可以影响产品。即使一次完整运行结束后,仍可能因代码改动无效、数据窗口泄漏、评估语义漂移或两条实验路径走向不同的服务渠道而得出错误结论。
我们提出 EvoPilot,这是一种面向长期在线自动研究的人机门控方法。针对每一轮实验,角色特定的代理通过版本化的领域技能和类型化适配器执行任务。持久化记录保存实验过程和失败案例,确定性检查确保已记录的经验教训被遵循。
我们在 Video Deep Dive(VDD)检索系统上开展了为期 37 天的实验。VDD 为用户打开种子视频后提供后续视频的发现体验,使用每小时刷新、包含数亿视频的索引。此前的手工实验未能证明交互头(interaction head)带来收益。一次原始的自动研究尝试重新审视该方向,却错误地将离线命中率下降 22% 归因于交互头。引入 EvoPilot 后,人机门控的验证将下降追溯到已有的评估缺陷,该缺陷导致输出深度分别为 3000 与 600。修复后,匹配比较显示离线提升 3.20% 点。
事后回放与变异测试剔除了无效比较,保留了有效对照。持久化状态帮助恢复了中断的实验轮次,复用产出避免了约五小时的 GPU 计算。另行进行的为期七天的随机在线评估显示,VDD 片段的“保留率良好搜索结果率”(GSRR)相对提升 0.66%。
点评