广告视频生成不仅是视频合成任务,更是一个需要依据产品信息进行推理的任务,其成功与在线业务指标直接挂钩。现有的视频基础模型能够根据多模态条件生成逼真片段,但它们并未优化如何将产品转化为有效广告,也未利用在线业务反馈来改进后续生成。为此我们提出 AgenticGen,一个奖励引导的智能体框架,将广告视频生成拆解为 策略选择 与 草稿生成 两个可训练的推理阶段,从而暴露出可由在线业务反馈监督的优化目标。
AgenticGen 首先从累计的在线反馈中学习基于性能的奖励,同时构建与人工质量标准对齐的 rubric‑based 奖励。随后采用 DPO(Direct Preference Optimization)将智能体策略向在线偏好靠拢,接着使用 GRPO(Generalized Reward‑based Policy Optimization)在过程奖励和结果奖励的双重约束下进一步细化两个阶段的策略。
离线实验验证了奖励模型的有效性以及逐步策略优化的提升。在线 A/B 实验在 TikTok 广告系统中显示,经过 DPO 与 GRPO 调优的 AgenticGen 相比 SFT 基线提升了 CTR 2.72%、CVR 2.63%、以及广告收入 Advv 9.61%。
点评