摘要
新用户冷启动是电子商务平台的关键瓶颈:预测用户生命周期价值(LTV)和转化率(CVR)面临稀疏的交互历史。以往的两种方向——基于大语言模型(LLM)的语义增强和使用特权信息学习(LUPI)——各自面临重要局限。首先,LLM增强生成的非结构化推理噪声较多,难以在生产中实际应用。其次,简单的学生-教师蒸馏可能因特权教师与稀疏学生之间的信息差距而变得脆弱;而且,这一差距在用户之间是异质的。
为了解决这两个问题,我们提出了SemRaD,一个语义推理感知的蒸馏框架。首先,结构化语义推理管道通过发现-策划-审计工作流程,替代了自由形式的推理,生成每个用户的浓缩语义档案(由部署的学生通过语义门控编码器消耗,重点关注最有信息量的维度)和回顾蒸馏目标(根据前后转化推理进行调整,仅在训练时使用)。其次,为了弥合这一差距并处理其异质性,回顾感知蒸馏网络通过回顾目标转移特权知识,蒸馏专家在每个用户的可变性下提高了知识转移的效果。
在一个大规模工业数据集上,SemRaD提升了+1.9%的LTV(Gini)和+1.0%的CVR(AUROC),相较于生产级基线;在Keeta进行的为期四周的在线A/B测试确认了+1.0%的LTV / +0.43%的CVR。SemRaD在仅使用9%的训练数据的情况下,实现了与生产系统相同的LTV,同时将CVR提高了0.8%。
博主点评: SemRaD通过引入结构化推理和回顾蒸馏,成功解决了冷启动问题中的信息缺失和噪声问题。其在大规模工业应用中的表现,展示了新兴技术在实际环境中的巨大潜力,值得关注。优化用户价值的同时,改善了转化率,为电子商务平台提供了新的解决方案。