随着大语言模型(LLM)的快速发展,基于 LLM 的代理系统在处理需要多步思考或工具交互的复杂任务时展现出巨大潜力。要在精心设计的代理范式中充分发挥 LLM 的能力,往往需要在多种代理场景下进行后训练,以提升模型表现。\
在众多后训练技术中,PPO、DPO、DIL、GRPO 等对齐方法因能够在惩罚负样本的同时保持可接受的训练复杂度而广受关注。然而,这些方法大多针对单回合任务,对多回合复杂任务的适配仍有提升空间。\
本文提出 回合级多尺度密度比估计(tlm‑DRE),核心思想是为不同回合分配不同权重,并基于正负样本在多回合任务中的空间差距进行 不对称的 token 级训练。具体做法是:\
- 对每个回合 $t$ 计算正负样本的密度比 $r_t = \frac{p_t(x)}{q_t(x)}$;\
- 根据 $r_t$ 的大小动态调整该回合的损失权重 $w_t$,使得正样本与负样本的分布差距更大时给予更强的学习信号;\
- 在 token 级别上,对正样本使用标准交叉熵,对负样本则加入基于 $w_t$ 的加权惩罚,从而实现不对称学习。\
实验在多个公开的代理基准上进行,包括工具使用、对话规划和代码生成等任务。结果表明,tlm‑DRE 在整体表现上与传统对齐方法持平或略有优势,尤其在 多回合推理 场景下表现更为稳健,能够在域内和域外条件下保持较高的成功率。\
该方法的优势在于:\
- 通过回合级权重捕捉长序列中的信息重要性差异;\
- 不对称的 token 级训练有效放大正负样本间的信号差距;\
- 训练复杂度与现有对齐方法相当,易于在现有 LLM 训练流水线中集成。\
点评:tlm‑DRE 为多回合任务提供了细粒度的对齐手段,填补了现有单回合对齐方法的空白,值得在更广泛的 LLM 代理系统中进一步验证和扩展。