语义ID(Semantic-ID)生成式推荐将检索与排序统一为对层次化商品标识的自回归生成。常见做法是先进行监督微调(SFT),随后使用基于奖励的生成式后训练(GRPO)。然而, vanilla GRPO 与树结构任务匹配度不足:在冻结的 SFT 检查点下,许多提示的目标在 50‑beam 限制排名的前 16 条候选中根本不存在,甚至在更困难的情况下,所有候选都脱离了目标 SID 分支。该现象提示一个训练问题:当 on‑policy GRPO 组同样缺失目标时,基于项目的奖励即使在部分候选沿着目标路径前进,也可能产生微弱或退化的奖励变化。
为了解决这一失效模式,我们提出 Difficulty‑Aware Semantic‑ID Optimization(DASO),将其视为在线 rollout‑allocation 问题。DASO 不使用固定难度桶或均匀注入真实完成,而是对当前 rollout 组按前缀匹配深度进行画像,定位候选离开目标路径的瓶颈 SID 层级,并在保持原始 rollout 用于对比的同时,将有限比例的组重新分配给前缀引导的完成。我们引入 SID‑prefix 奖励以提供分级信用,并使用辅助的 SFT 锚点防止在已被 SFT 检查点解决的示例上出现回退。
在公开基准上,DASO 在 12 项指标中有 11 项优于 MiniOneRec 风格的 GRPO,并在 9 项指标上取得最佳成绩;在内部推荐任务中也提升了多数层级召回指标。
博主点评: DASO 通过细粒度的树结构感知和动态 rollout 分配,有效缓解了传统 GRPO 在层次化推荐中的稀疏奖励问题,展示了后训练阶段对生成式推荐系统的显著提升潜力。