NeFut Logo NeFut
EN 管理员登录

[AI学术] 预算阈值激励的一般框架

发布于:2026-09-26 22:00 最后更新:2026-09-28 00:49
#algorithm #AI #optimization

按需配送平台通过激励活动向骑手支付报酬,这些活动的层级依据近期完成相似任务的骑手数据设定。运营方经常需要在假期或恶劣天气等特殊时期,针对不同的骑手群体、支付规则和预算提出临时方案,而随机试验既稀缺又耗时。我们提出一种请求驱动的框架,将四个阶段——条件预测、人口缩减、轨迹整合和预算分配——通过七个可替换模块进行组合,这些模块交换条件轨迹分布,产生对应的奖励概率和奖励时刻,从而适配任意活动规则。响应校正步骤利用大量无激励历史对轨迹重新加权,使其匹配短期试点的统计特征。我们证明,在固定方案集合且已知各阶段误差的前提下,端到端的价值损失上界等于四个阶段误差之和,并且每个阶段都有可能成为不可忽视的瓶颈。实验在 3,000 名骑手、45 条每周起点的场景中,全部 127 个时间窗口的响应速度提升 11.04 倍,价值损失不超过 0.92%。在 24 种新控制响应规则下,使用一周试点的响应校正将后悔值降低 51.2%,而四周试点的精确求和误差仅为 0.007,几乎等同于 18 周的完整试验。实际注册研究表明,当窗口、人口、规则和预算在不同请求间变化时,框架的后悔值始终低于等量骑手周的随机试验,并且比仅使用试点数据的剂量插值更优。一次性准备工作可复用,帮助 60 次请求分别提升 14.1 倍和 2.70 倍的响应速度,答案保持一致。与使用框架自身剂量曲线的九次报价试验相比,一周的后悔值降低 0.055。

点评

原文链接: https://arxiv.org/abs/2609.29724

[h] 返回首页