将图像生成模型包装在具备记忆、技能、工作流编排、结果验证和迭代改进能力的代理系统中,可显著提升文本到图像任务的表现。代理通过不断构造和修正提示词,引导扩散模型生成更优图像,但这些提升仅在完整的代理系统运行时才会显现,模型本身的权重并未获得相应的改进。为了解决这一限制,我们提出了Diffusion On-Policy Context Distillation (D‑OPCD)。该方法将代理改进后的提示词视为特权上下文,将代理系统中蕴含的知识蒸馏进扩散模型的权重,使模型在仅接受原始查询时也能保留部分代理的增益。我们在配备 Auto Skill Evolver (ASE) 的文本到图像代理上进行实验,结果显示 D‑OPCD 能将四个基准的直接生成得分从 60.52 提升至 65.09。权重吸收了这些知识后,原有的代理系统可以去除已饱和的技能并继续演化:在更新后的生成器上进行第二轮 ASE 训练,相比无技能的代理系统再提升 1.83 分,表明代理与模型可以通过持续的共同进化互相促进。
点评