NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于多模态大模型的推荐系统中可扩展的用户阐述理由

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #LLM

现代推荐系统主要依赖点击、观看时长和负向反馈等隐式行为来推断用户偏好,这些信号只能说明用户做了什么,却无法解释用户为何喜欢或不喜欢某个内容。本文引入了可阐述用户理由(AUR),即用户用自然语言表达的偏好解释,作为一种兼具极性和理由层次的文本信号。AUR 本身稀疏、质量参差不齐且仅覆盖少量商品,导致在工业系统中难以直接使用。

SARA(Scaling Articulated Rationales)框架首先构建数据引擎,从 2.4 亿快手直播用户中收集并筛选 AUR,形成质量受控、以作者为中心的 SARA‑HQ 数据集。随后通过大规模监督微调(SFT)和质量提升的 DPO,将通用多模态大模型对齐为 SARA‑7B,使得从原先覆盖 86,564 位作者的生成能力扩展到全量 1,000 万作者。最后,SARA‑Ranker 将生成的正向和负向理由注入生产排序,采用理由感知交互建模和拒绝记忆建模两大机制。

离线评估、人工校准以及线上 A/B 实验表明,SARA‑7B 生成的理由更具体、极性一致且基于事实,相比强基线模型提升了推荐点击率并显著降低了负向反馈。系统已实现每日刷新并稳定运行超过 30 天,验证了 AUR 作为工业推荐系统一等文本信号的可行性。

点评

原文链接: https://arxiv.org/abs/2609.17639

[h] 返回首页