NeFut Logo NeFut
EN 管理员登录

[AI学术] 从批评到信心:基于语言的定量预测中的 PPO 与置信度估计

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#algorithm #AI #Machine Learning

在处理非结构化输入时,大型语言模型(LLMs)能够进行基于语言的定量预测,但它们仍然容易出现幻觉和过于自信的错误,因此了解模型的预测结果及其可信度至关重要。

我们提出了 CARE-PPO,这是一种强化学习框架,它将不确定性估计的损失预测与演员-评论家 PPO 微调建立了联系,从而实现了在基于语言的定量预测中准确数值估计和可靠置信信号的联合学习。

CARE-PPO 使用置信度对齐奖励(Confidence-Aligned Reward for Estimation),该奖励作为预测误差的函数,向演员提供密集的错误感知反馈,同时促使评论家学习与预测质量对齐的价值函数。

在推理过程中,我们将评论家重新利用为置信度估计器。在医疗和金融的两个实际任务中,以及两个 Qwen-3 模型规模(4B 和 8B)下,CARE-PPO 实现了强大的定量预测性能,且通过评论家生成的置信度估计显著优于基于 logit 的和语言化的基线。

这些增益在不同领域的现实分布外设置下依然有效,涵盖了语言和领域的转变。最后,CARE-PPO 减少了针对特定任务的过拟合,与 RL 微调相较于监督方法在更广泛的泛化优势一致。

博主点评: CARE-PPO 在置信度估计方面的创新性应用,通过强化学习与传统方法的结合,展现了更高的预测性能和可靠性。这为未来的语言模型在复杂领域的应用提供了新的思路,尤其是在医疗和金融等关键领域,进一步推动了定量预测的可信性提升。希望更多研究能借鉴此框架,以解决模型的过拟合和不确定性问题。

原文链接: https://arxiv.org/abs/2607.12687

[h] 返回首页