摘要
智能系统在与真实环境交互、利用外部工具和为用户提供服务的能力上迅速发展。然而,与假设有明确指令的自然任务不同,人类中心场景的请求往往模糊,导致较大的开放式解决方案空间。因此,解码用户的个性化偏好对于缩小候选解决方案空间至关重要。这引入了一项新挑战——个性化智能推理,要求智能体与用户和环境共同互动,以提供个性化服务。
在本文中,我们提出了ODYSSE,一个用于个性化智能推理的强化微调(RFT)框架。ODYSSE的核心是提出了一种新的Episode-wise Group Relative Policy Optimization(ESPO),旨在解决个性化智能推理中的长动作时间跨度和强跨步骤依赖性。与独立优化单个步骤不同,ESPO引入了基于情节的奖励机制以及情节优势估计,使得上游证据能够有效指导下游个性化决策,并允许智能体在多个交互步骤中逐步解决模糊的用户请求。
我们进一步提出了一种情节批采样器,将同一情节中的动作分组为统一的训练批次,从而促进ESPO下的连贯优化。我们在现实的长时间个性化GUI推理任务上评估了ODYSSE。实验结果表明,ODYSSE在个性化智能推理任务上始终优于专业和通用的LVLM,强调了其有效性。
博主点评: ODYSSE通过引入情节级优化机制,显著提升了个性化智能体在复杂环境中的推理能力。这一方法不仅解决了传统模型在长时间跨度操作中的不足,还有效提高了用户请求的解析精度,具有广泛的应用前景。其在真实场景中的表现也为未来智能系统的个性化发展提供了重要参考。