现实中的推荐往往发生在用户与推荐系统共享的物理环境中,这要求对话推荐系统能够同时考虑对话历史、共同观察到的场景以及场景内物品的属性。该任务被称为情境对话推荐(SCR),其核心难点在于:一是如何在对话过程中准确捕捉用户的情境化偏好;二是如何生成既满足用户需求又符合当前情境的回复。
Re2A 将 SCR 表述为“先推理后对齐”的结构化过程。首先引入基于评分表的偏好推理(rubric-based preference reasoning),通过自动化评分表将模型的输出约束为显式的偏好状态。随后在此基础上进行偏好条件化优化(preference‑conditioned optimization),使生成的回复同时最大化用户偏好满足度和情境一致性。
在两个公开的 SCR 数据集上进行的大规模实验表明,Re2A 在准确性和情境感知方面均显著超越现有最先进方法。代码已开源于 https://github.com/DongdingLin/Re2A。
点评