强化学习(RL)在大型语言模型(LLMs)上的任务中取得了显著的成果,尤其是在具有固定、可验证的奖励的任务中,如数学推理和代码执行。在这些环境中,环境遵循固定的规则,不会对代理进行战略性的适应。然而,战略对话则不同,环境是另一个会适应代理策略的代理,成功取决于两方的交互。尽管如此,当前的RL方法通常会训练一个目标代理与固定的对手或模拟器。我们发现这种训练范式会鼓励策略去利用对手特有的规律性,而不是学习可以在不同对手中泛化的策略。我们将这个问题称为静态对手不匹配问题,并在实验中直接量化了它。为了解决这个问题,我们提出了隔离双边强化学习(IB-RL),其中两个角色通过联合回放同时进化,每个角色通过完全独立的优势、动作掩码和更新路径来优化自己的奖励。我们在两个领域中评估了冻结的策略与完全独立的保留对手。对于Vehicle TeleSales,IB-RL实现了89.6%的成功率@1,相比之下,最好的单边RL基线为84.6%。对于Deal-or-NoDeal,它达到了98.4%的协议,与DeepSeek V4 Pro相比,最好的单边基线为86.4%。这些结果表明,联合训练两个角色并保持严格的每代理隔离,可以产生更有效地泛化到未见对手的策略。 博主点评: 隔离双边强化学习能够有效地解决战略对话中的静态对手不匹配问题,通过联合训练和保持隔离,能够产生更强健和泛化的策略,这对强化学习领域具有重要的意义和应用潜力。