工具调用智能体会交替输出结构化的工具调用指令和面向用户的自然语言摘要,这种输出的异构性在标准的 on‑policy 强化学习中会导致结构性失效。GRPO 等算法会把统一的轨迹级标量优势广播到所有 token,结果是摘要生成的梯度噪声会泄漏到工具决策 token,形成跨段信用误归因,使得优化过程脆弱。
为了解决该问题,本文提出 SLCA‑GRPO 框架,引入段锁定信用分配(Segment‑Locked Credit Assignment,SLCA)。首先构建 Schema‑Guided LLM Simulator(SGLS)作为训练基础设施,以避免真实 API 的高成本并保持训练稳定。SLCA 在同一组 rollout 中对结构化段级别进行优势估计,无需从中间状态额外采样 rollout。
层级奖励(Hierarchical Rewards,HierR)进一步将执行优势只分配给工具 token,将偏好优势只分配给摘要 token,从而在每次策略更新中消除优势污染——这是跨段信用误归因的主要渠道。实验在 7B 主干模型上进行,SLCA‑GRPO 在相同训练预算下收敛更快,分别在内部评测上提升 2.53 个百分点,在 Berkeley Function‑Calling Leaderboard(BFCL)上提升 1.36 个百分点,在 $\tau^2$‑Bench 上提升 9.15 个百分点,并显著降低工具冗余和调用成本。
点评