摘要
随着控制理论在LLM代理中的应用逐渐增加,本文提出了一种新的视角来理解受控变量。以往的研究主要集中在工具选择、代理间的信息路由或原始动作流的控制,而我们将上下文组装本身视为受控变量。这包括选择哪个提示模板、使用多少个示例、检索多少上下文、进行多少次规划/验证等。这一过程通过上下文策略 $\\pi_\phi$ 与内部冻结策略 $\\pi_\theta$ 的形式分解来实现。
关键贡献
- 稳定性论证:基于Zhang等人(2026)的研究,证明了在线控制器在有限策略变更下的期望奖励是非递减的。
- 不确定性校准分析:对控制器的自信度与实际任务结果进行分析,确保其输出的可靠性。
- 实验实证:在三个领域和两个模型提供者中实例化相同的控制器,并发布数据集、轨迹日志及部署配方。
结论
本文的贡献在于为上下文组装提供了一个新的控制理论框架,强调了在线学习与策略控制的重要性,为未来的LLM代理研究奠定了基础。
博主点评: 这篇论文提出了一个创新的视角,将上下文组装作为受控变量,突破了传统的工具选择和动作流控制思路。通过控制理论的应用,可以为LLM代理的策略优化提供更为稳健的理论支持,值得深入研究与探讨。