NeFut Logo NeFut
EN 管理员登录

[AI学术] GVPO++:面向大语言模型后训练与在线蒸馏的组方差策略优化

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#Machine Learning #optimization #LLM

后训练是提升大语言模型(LLM)推理能力和任务专精度的关键环节。现有方法如 Group Relative Policy Optimization(GRPO)在实际部署时常因依赖重要性采样而出现训练不稳定。我们提出 Group Variance Policy Optimization(GVPO),它将 KL 约束的奖励最大化的解析解嵌入梯度加权机制。该机制的直观解释是:GVPO 的梯度等价于隐式奖励中心距离与真实奖励中心距离的均方误差。

GVPO 具备两大优势:

  1. 通过解析解保证唯一最优解,恰好对应 KL 约束奖励最大化目标;
  2. 允许灵活的采样分布,无需重要性采样。

形式上,KL 约束的奖励最大化可表为 @@@MATH_BLOCK0@@@\nabla J = \mathbb{E}{\pi_{old}}\big[ w\,(\hat{R}-R)^2 \big]$$ 成为中心距离的均方误差。

除了通用后训练,GVPO 还能自然扩展到 On‑Policy Distillation(OPD)。在 OPD 场景下,GVPO 同样提供唯一最优解,并支持一族扩展的 OPD 目标,使得目标设计更加原则化。

综上,GVPO 将理论保证与实用灵活性统一,为 LLM 的可靠后训练和多样化在线蒸馏提供了新范式。

点评

原文链接: https://arxiv.org/abs/2609.21432

[h] 返回首页