NeFut Logo NeFut
EN 管理员登录

[AI学术] 冻结LLM代理学习领域的控制系统与数据集全攻略

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #Reinforcement Learning

摘要

随着生产LLM代理的逐步成熟,这些代理越来越多地由一个冻结模型和一个控制框架组成:包括提示模板、工具集、记忆/检索层、规划策略和验证政策。2026年的两个系统,Meta-Harness(Lee et al., 2026)和HyperAgents(Meta AI, 2026),展示了该控制框架可以被代理提议者优化或自我重写,但代价是需要一个昂贵的代码搜索循环或不受限制的自我修改代码,这两者都无法审计或与完全黑箱模型API一起使用。

我们采取了一个更狭窄且受限的立场:将控制框架视为一个小且固定的人类可读动作空间,并通过经典的样本高效强化学习(如 $ ext{ε}$-贪心上下文赌博机和REINFORCE)在线学习策略,依据多目标奖励进行评分(任务成功率、验证者评分、政策合规性、成本、延迟和不支持声明的惩罚)。我们将此控制系统实例化为DSPy(Khattab et al., 2024),作为上下文组装器和最强非自适应基线(DSPy BootstrapFewShot静态提示)的来源,并在三个可验证任务领域进行评估——工具使用工作流、代码生成(HumanEval)和多跳检索问答(HotpotQA),以及两个模型提供者(本地Ollama模型和AWS Bedrock)。我们发布了控制框架代码、跨领域可验证任务套件、训练过程中的完整轨迹/奖励分解日志,以及一个适用于新组织领域和验证设置的提供者无关部署食谱。

博主点评: 本文提出了一种新颖的控制系统,通过样本高效的强化学习方法优化冻结LLM代理的行为,具有巨大实用价值。控制框架的灵活性和可验证性为未来的LLM应用提供了新的思路,值得深入研究与实践。

原文链接: https://arxiv.org/abs/2607.25415

[h] 返回首页