NeFut Logo NeFut
EN 管理员登录

[AI学术] 从贝叶斯视角统一 ICL、SFT 与 KL 正则化 RL

发布于:2026-09-08 22:00 最后更新:2026-09-09 09:08
#AI #Machine Learning #LLM

大型语言模型的训练与评估如今涵盖监督微调(SFT)、少样本上下文学习(ICL)、KL 正则化的 RLHF/RLVR、在线蒸馏(OPD)以及测试时的搜索与链式思考等多种范式。表面上这些方法看似截然不同,甚至出现了少样本提示对 RL 调优的推理模型影响不一的现象。本文提出一种贝叶斯视角,将它们统一到同一框架下。核心是两步模板:(i) 给定上下文,利用先验/参考模型和效用信号(对数似然、奖励或优势)构造(广义)贝叶斯或 Gibbs 后验 $q^{*}$;(ii) 将 $q^{*}$ 通过前向 KL 投影到参数化族上,投影可以在权重空间(对应 SFT/RL)也可以在上下文空间(对应 ICL)。

第一部分形式化了少样本 ICL 与 SFT 为对贝叶斯后验预测的权重或上下文投影。第二至四部分证明,KL 正则化的 RLHF/RLVR、奖励加权 SFT、奖励加权 ICL(RW‑ICL)以及优势加权 SFT(AWSFT)都是对由奖励或优势诱导的后验进行前向 KL 投影的特例。我们进一步区分了这些等价关系成立的层面(目标函数与一阶更新)和不成立的层面(学习信号的来源与粒度)。

第五部分讨论了对现代推理流水线的启示:RLHF/RLVR 可视为“后验设计 + 投影”,重要性加权的 KL 投影在实际中必须依赖冷启动或监督预热;DeepSeek‑R1 与 o1 系列模型则将测试时的贝叶斯搜索与训练时的 KL 摊销相结合,形成更强的推理能力。

点评

原文链接: https://arxiv.org/abs/2609.05111

[h] 返回首页