NeFut Logo NeFut
EN 管理员登录

[AI学术] FSPO:预算约束下的策略一致风险与帕累托可行控制

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#algorithm #Machine Learning #LLM

自适应大语言模型(LLM)强化学习后训练会在线调节温度、批量大小、裁剪、KL 正则、验证器分配和更新预算等多个训练执行器。仍有三大耦合难题未解:① 用行为轨迹训练的未来风险模型未必能估计实际部署控制器产生的风险;② 基于已记录状态‑动作对校准的分数在选择性动作后会失准;③ 各资源的独立最小成本并不能保证多资源的续航可行。FSPO(Feedback‑State Policy‑consistent Optimizer)同时解决上述问题。它学习一个策略一致的风险‑to‑go模型,其 Bellman 目标使用与未来决策相同的冻结控制器,并配套一个长视野效用模型。决策条件轨迹校准(DCTC)在交叉拟合的轨迹上校准风险,这些轨迹由临时控制器选取的动作生成。帕累托资源续航证书(PRCC)仅在剩余时域内仍有非支配的累计预留资源可行时才允许动作执行。实验在匹配的 GRPO 资源包下,FSPO 在持出集上达到 66.11% 准确率、OOD 上 59.43%,分别比最强基线 PB2 的 64.47% / 57.03% 有显著提升。三组配对训练种子相较于上下文赌博机在持出和 OOD 评估上分别提升 2.42 与 3.19 个百分点。高行为‑部署不匹配情形下,策略一致风险将选决策的期望校准误差(ECE)从 0.108 降至 0.053;DCTC 在匹配接受率下将 ECE 从 0.039 降至 0.022;PRCC 将 18‑动作目录的错误可行率从 $0.197$ 降至 $0.000$;三组件全开时,轨迹失败率从 $0.181$ 降至 $0.083$(因子消融实验)。

点评:FSPO 通过统一风险建模、跨轨迹校准和资源帕累托约束,实现了在预算受限的 LLM 强化学习后训练中更可靠、更高效的决策控制,为实际部署提供了可解释的安全保障。

原文链接: https://arxiv.org/abs/2610.02828

[h] 返回首页