NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破性的多模态推理强化学习框架 O²-CritiCuRL

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#algorithm #AI #Machine Learning

摘要

多模态大语言模型在推理任务中展现了能力,但常常在中间步骤上产生错误,尽管最后答案正确。这种现象削弱了模型的可解释性和可靠性,表明其依赖于虚假的捷径而非真实的推理。虽然已有研究探讨了步骤级监督,但区分关键步骤与冗余步骤依然具有挑战性。

我们提出了 $O^2$-CritiCuRL,一个新颖的课程强化学习框架,通过迭代的离线-在线范式引入关键步骤意识。在离线阶段,$O^2$-CritiCuRL 对步骤标注的轨迹进行多次回放分析,以估计步骤级重要性,从而提炼关键推理步骤并过滤掉冗余步骤。

在在线阶段,我们采用渐进式步骤级强化学习策略,通过截断链引导模型推断缺失步骤并优化其推理,从而增强对关键步骤的关注,克服静态监督的局限性。

在多模态推理基准上的大量实验表明,我们的方法实现了最先进的性能,同时提供了更高的训练和推理效率。代码可在 GitHub 获取。

博主点评: O²-CritiCuRL 的提出为多模态推理提供了新的思路,通过引入关键步骤的意识,显著提高了模型的推理质量与效率,值得在实际应用中深入探索。

原文链接: https://arxiv.org/abs/2607.23700

[h] 返回首页