忠实的用户模拟是大规模构建、评估和改进交互式 AI 的基石。单轮的合理回复并不能保证模拟用户能够复现真实交互中意图的演变以及最终结果。我们提出 TRACER,这是一种多轮用户模拟器,显式建模用户意图的动态变化,并学习将模拟行为对齐到真实交互轨迹。
TRACER 的训练分为两阶段:首先在真实用户对话上进行监督微调,其次进行多轮强化学习。强化学习阶段结合了层次化的结果奖励与轨迹奖励,并引入偏差感知的优势调制机制,既缓解了奖励稀疏的问题,又解决了长对话中的信用分配难题。
在真实客服会话数据上按参考队列进行评估,TRACER‑7B 相比最强基线提升了 11.4 的转化 F1,同时实现了最低的群体转化率误差和语义轨迹距离,并在分布外场景中保持良好泛化。人工图灵测试的识别准确率接近随机水平,说明生成的对话在自然度上得到了认可。
基于该模拟器,我们进一步构建了动态营销基准,用于联合评估 LLM 的说服效果和回复质量。实验表明,回复质量的提升并不必然带来转化率的提升。
点评:TRACER 通过意图建模与层次奖励实现了行为一致性的显著提升,为用户模拟提供了更可靠的评估平台,也为营销场景下的 LLM 研究指明了新的方向。