在线广告竞标系统通常依赖多个离线训练的专家模型(如PID控制器、模型预测控制、离线强化学习策略),但面临两个关键限制:对非平稳拍卖市场缺乏在线适应能力,以及对超参数(如出价边界和预算节奏约束)的昂贵手动调优。我们提出了HOBA(层次化在线投标代理),一种层次化强化学习框架,解耦了战略推理、模型选择和出价执行,涵盖三个时间尺度。
在高层次上,一个大型语言模型通过“思考-行动-观察-反思”循环,从上下文信号中推断超参数,并通过历史经验检索来增强决策。在中层,SARSA代理动态选择专家模型,并结合因果调整以消除选择偏差。在低层,动态专家池(PID、MPC、IQL、决策变换器)在高层约束下执行出价。此设计将在线学习限制在离散专家选择上,而非连续出价优化,显著降低了探索风险,同时保持了适应性。
在AuctionNet基准上的实验和大规模A/B测试表明,HOBA在性能上持续超越现有最优基线。在大规模在线部署中,HOBA实现了显著的商业价值,目标成本提高了3.6%,证明了我们层次化多代理投标范式的有效性。
博主点评: HOBA的提出为在线广告竞标领域带来了新的思路,通过层次化的强化学习框架,解决了传统方法的局限性,尤其是在线适应性和超参数调优的挑战。这一创新有望在实际应用中产生显著的经济效益,值得关注。