摘要
在线推荐平台越来越多地使用大型语言模型(LLMs)从广告创意中提取结构化特征。尽管在我们的生产环境中,单次调用的LLM注释代理显著提高了点击率(CTR),但逐个创意的提示方法在扩展时代价高昂。每个请求中发送的冗余系统指令占据了94%的计费输入令牌。为了解决这一成本瓶颈,我们引入了PromptPack,一个可扩展的高吞吐量LLM注释代理。
PromptPack通过上下文批处理实现了这一规模,结合了共享的系统提示、严格的XML结构封装和输出校正层,以确保在多个创意上同时进行确定性的、管道就绪的特征提取。我们通过使用下游逻辑回归排序器的离线检索基准对PromptPack进行了评估。
为了深入分析代理的行为,我们测量了AUC,并引入了体积加权绝对提升(VWAL),这一新颖的指标捕捉了生成特征的信号质量。与我们未批处理的生产基线相比,PromptPack在批处理大小为20时将LLM成本降低了89%,并将吞吐量提高了2.5倍,同时完全保留了AUC。
博主点评: PromptPack通过高效的上下文批处理和结构化封装,显著降低了LLM的使用成本,同时提升了推荐系统的性能。这一创新为在线广告行业提供了新的思路,值得关注其在实际应用中的表现。