基于大语言模型的角色扮演代理已广泛用于个性化助理和社会模拟等场景。传统的强化学习方法通常在学习前收集固定的情境池进行训练,这导致分布瓶颈:随着代理能力提升,表现不佳的情境会随之变化,而训练分布保持不变。为此我们提出 AdvRole,一种对抗式上下文重写框架,将角色扮演强化学习转化为闭环课程。AdvRole 在 Actor(学习角色扮演)和 Rewriter(编辑角色设定和对话上下文)之间交替进行。Rewriter 的训练目标是 performance‑gap reward,即倾向于生成使当前 Actor 得分相对于原始情境下降的难例。这样情境池会随 Actor 演化,持续聚焦角色‑上下文空间中未被掌握的区域。我们在三个涵盖英、中文的角色扮演基准以及新发布的多语言基准上进行实验,结果表明 AdvRole 始终优于各类基线方法。
点评