NeFut Logo NeFut
EN 管理员登录

[AI学术] PG-SFT:在离线智能体微调中平衡能力获取与保持

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

监督微调(SFT)在离线智能体轨迹上是训练专用工具使用智能体的常规方法,但逐标记模仿推理和动作可能削弱基模型的通用推理、工具调用和代码生成等能力。本文聚焦于在智能体轨迹 SFT 过程中,如何更好地平衡新能力获取与已有能力保持的权衡。实验比较了多种基线:标准 SFT 能提升目标基准分数,却会降低若干非目标基准;仅通过 KL 惩罚约束分布漂移或限制更新幅度并未阻止这种退化。受近期 token 级自适应学习目标的启发,本文提出特权引导 SFT(PG‑SFT),利用回合层面的信息增益作为指标,动态调节监督强度。PG‑SFT 在所有评测上实现了更为友好的权衡,显著抑制了分布漂移和广泛能力退化,仅以目标任务性能的轻微下降为代价。研究表明,平衡获取‑保持的关键不仅在于是否锚定基模型行为,还在于监督何时、以何强度偏离该行为。

点评

原文链接: https://arxiv.org/abs/2610.00949

[h] 返回首页