摘要
在航空旅行中,打包是一项重复且容易出错的任务:行李清单必须具有个性化和上下文意识,同时又要符合安全规则、物品依赖关系和行李限额。现有的打包助手要么依赖模板且通用,要么基于推荐但不受约束,导致用户需要手动修正合规性和容量违反的问题。
我们提出了一种推理引导的学习框架,包含三个阶段:
- 符号引擎:生成一个符合规则的种子清单,具有明确的依赖结构。
- 两阶段偏好学习器:从用户的添加和删除行为中估计包含和优先级效用,同时减轻生存偏差。
- CP-SAT 优化器:选择一个紧凑的、合规的子集。
该架构实现了约束个性化的一般模式,适用于硬性可行性与稀疏偏好信号共存的场景。在604个标注的旅行场景中,包含29K的包含标签和343K的成对比较,符号引擎的召回率达到99.7%,有效性为0.96,而前沿的LLM则在0.78到0.81之间。使用梯度提升树和LambdaMART的AUC-ROC达到0.943,NDCG@5为0.923。CP-SAT的约束满足率为100%,相比之下,贪婪选择为28%,随机选择仅为10%。
在生产iOS旅行应用FlyEnJoy中的部署,使得清单完成率翻倍,并减少了编辑和完成时间。
博主点评: 本文提出的框架有效地结合了推理与学习,实现在复杂约束下的个性化需求,展示了在实际应用中的显著效果,具有很大的推广价值。