现代推荐系统主要依赖点击、观看时长和负向反馈等隐式行为来推断用户偏好,这些信号只能说明用户做了什么,却无法解释用户为何喜欢或不喜欢某个内容。本文引入了可阐述用户理由(AUR),即用户用自然语言表达的偏好解释,作为一种兼具极性和理由层次的文本信号。AUR 本身稀疏、质量参差不齐且仅覆盖少量商品,导致在工业系统中难以直接使用。
SARA(Scaling Articulated Rationales)框架首先构建数据引擎,从 2.4 亿快手直播用户中收集并筛选 AUR,形成质量受控、以作者为中心的 SARA‑HQ 数据集。随后通过大规模监督微调(SFT)和质量提升的 DPO,将通用多模态大模型对齐为 SARA‑7B,使得从原先覆盖 86,564 位作者的生成能力扩展到全量 1,000 万作者。最后,SARA‑Ranker 将生成的正向和负向理由注入生产排序,采用理由感知交互建模和拒绝记忆建模两大机制。
离线评估、人工校准以及线上 A/B 实验表明,SARA‑7B 生成的理由更具体、极性一致且基于事实,相比强基线模型提升了推荐点击率并显著降低了负向反馈。系统已实现每日刷新并稳定运行超过 30 天,验证了 AUR 作为工业推荐系统一等文本信号的可行性。
点评