NeFut Logo NeFut
EN 管理员登录

[AI学术] 可证明认知:以现实结算奖励弥合验证鸿沟

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

前沿的语言模型推理提升主要来源于对推理轨迹的强化学习,而这种提升集中在拥有廉价且可靠验证器的领域。我们认为当前的瓶颈是 验证鸿沟:缺乏可扩展、不可腐败的推理奖励,尤其在形式化之外的任务中。本文提出四项贡献。(1) 理论层面:在最佳‑N 选择的联合高斯模型中,验证器与黄金答案的相关系数 $\rho$ 正好是测试时计算资源与模型能力之间的兑换率;若验证器不可靠,则会产生多项式惩罚 $N^{1/\rho^2}$。基于无边际 copula 的形式能够以约 4% 的中位误差预测真实 LLM 判官的可靠性。(2) 实验层面:在可执行真值的程序合成基准上(包括预注册的规模复制实验),不可靠的验证器在优化规模增大时会出现 压力下的可靠性下降($\rho$ 从 0.94 降至 0.32,$N=4096$),而可靠验证器则单调提升。基于现实的结算标签在 i.i.d. 与对抗性压力下均优于冻结的验证器,将黑客攻击差距从约 0.27 缩小至接近 0;结算标签的可靠性随标签数量呈对数线性增长,策略性结算的标签效率约为随机标注的 10 倍。使用真实 LLM 判官和单元测试执行作为黄金标准时,弱判官在最佳‑N 场景下会失去可靠性。

点评

原文链接: https://arxiv.org/abs/2609.09776

[h] 返回首页