摘要
大型语言模型(LLM)的性能越来越依赖于基础模型和用于组织推理的推理时间控制器。然而,现有的后训练方法通常只针对单一固定的交互模式进行优化,这与实际部署中依赖的多样化控制器(如思维链、自我一致性、辩论、规划和验证管道)存在着训练与部署的不匹配,限制了向新工作流的迁移。我们引入了CALM(Controller-Aware Language Models),一个后训练框架,明确将控制器纳入训练循环。
我们将控制器感知的后训练形式化为基于控制器引导的交互协议的多任务强化学习,其中控制器是可重用的局部推理模块的组合。这个结构还在回合级GRPO目标下引入了混合控制器训练的模块级分解,从而能够系统地研究控制器和模块感知的训练策略。我们在保留的控制器组合和更广泛的控制器转变上评估了CALM,结果表明,控制器感知的后训练在推理时间工作流中比单一控制器优化更能提高泛化能力。
博主点评: CALM框架的提出为大型语言模型的灵活应用提供了新的思路,强调了控制器在推理过程中的重要性。通过多任务强化学习的方式,模型能够适应多样化的交互需求,展现出更强的泛化能力,推动了自然语言处理领域的进一步发展。