NeFut Logo NeFut
EN 管理员登录

[AI学术] 多LLM协同对齐:基于Stackelberg博弈的自适应指令课程

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

一组语言模型可以通过相互学习彼此的回复实现协同提升。模型之间的交互受训练时使用的指令影响。已有方法通常对指令进行均匀抽样,然而指令的价值会随模型能力变化:曾经导致回复质量差异的指令可能后来被同等回答,而原本困难的指令则可能提供有价值的学习信号。

我们提出 Stackelberg Alignment,一种受博弈论启发的领袖‑追随者框架,将指令选择转化为自适应课程。领袖使用 EXP3 多臂赌博机在固定抽样预算内分配指令,并依据指令难度与回复可辨别性构造奖励来更新抽样分布。模型作为追随者:对领袖挑选的指令作答,互相评估对方的回复,并通过 DPO 或 GRPO 从偏好信号中学习。框架采用 Elo 风格的声誉加权同行评判,并利用声誉进行对手匹配,以保证交互的可靠性和竞争性。

在三个异构模型池和覆盖科学发现、推理、代码、指令遵循、知识等 12 项基准的实验中,Stackelberg Alignment 在宏观平均指标上领先所有对照组,在三类模型池中最高提升 7.4%,相较最强的训练时基线提升 7.4%,相较最佳的静态推理基线提升 12%‑25%。进一步分析表明,自适应领袖会将对决集中在信息量最大的指令上;消融实验显示,声誉加权评判和基于声誉的匹配均显著提升多LLM进化的效果。

点评:该工作将博弈论与自适应课程相结合,为多模型协同学习提供了系统化方案,实验验证了其在多任务、多模型环境下的鲁棒性和优势。

原文链接: https://arxiv.org/abs/2609.39076

[h] 返回首页