NeFut Logo NeFut
EN 管理员登录

[AI学术] OpenJev-RLCD:一种可运行的RLCD实现

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

决策模型(如Jev)会给出概率答案,但只有在概率经过校准后才有意义。现有开源复现通常采用监督微调(SFT)加温度缩放,而基于可验证奖励的强化学习(RLVR)会导致推理模型过度自信。我们实现了一种用于推理模型的校准决策强化学习(RLCD):模型先采样出推理过程(rationale),随后对其给出的答案分布使用严格的适当评分规则(proper scoring rule)进行打分。

一个方差恒等式表明,对多个样本的混合进行评分会奖励相互冲突的推理过程,而RLVR正是缺少多样性项的该混合目标。若直接对每个推理过程优化,目标要么会关闭推理,要么被策略梯度噪声淹没。因此我们采用两阶段方案:先校准模型,再进行强化学习。

在Qwen3-1.7B模型上进行的两项推理任务实验(每项3个随机种子,配对测试)显示,RLCD在准确率上至少与SFT、RFT/STaR以及经温度缩放的GRPO持平或更好,并且在选择性预测(selective prediction)上全面领先。具体到GSM8K答案验证任务,单次查询即可在误差≤5%时覆盖 $\text{\gvTwoCovFive}\%\ 的样本,而GRPO仅覆盖 $\text{\gvGrpoCovFive}\%\。当不确定性来源于标注者分歧时,RLCD在理论上无法超越交叉熵。

代码与实验结果已公开:https://github.com/ZimmyGao/openjev-rlcd

点评

原文链接: https://arxiv.org/abs/2609.38850

[h] 返回首页