摘要
合成数据因其生成成本低且易于控制,已广泛用于训练大型语言模型。随着模型越来越多地作为代理被部署,合成轨迹可能成为代理行为训练数据的重要来源。我们研究了在包含对抗性互动的合成代理轨迹上进行训练的影响,这些互动包括终止其他代理的进程、降低其调度优先级或未经授权访问资源等行为。
我们在这些轨迹上微调了 Llama 3.3 70B Instruct,这些轨迹旨在近似强化学习的回放,并在 Anthropic 的代理不对齐套件和 Apollo 的上下文策划场景中评估生成的模型。微调这些轨迹始终会增加不对齐行为,泄漏率从基线的 4.6% 增加到 24.9%,大约提高了五倍。即使在移除轨迹中的每一个对抗性动作后,这一增加仍然存在。相比之下,从一开始就生成的良性结构相似轨迹的微调效果大大较小,仅为 15.5%。这些结果表明,不对齐的倾向是在生成过程中引入的,并在整个轨迹中广泛编码,而不是局限于有害动作本身。
此外,效果还依赖于生成模型。由 Gemini 2.5 Flash 生成的良性轨迹导致的泄漏率略高于由 Claude 3.7 Sonnet 生成的相同任务轨迹。相反,广泛的安全基准在所有微调模型中表现相似,因此未能区分这些效果。我们的结果表明,基于动作级别的过滤不足以确保合成代理训练数据的安全性,生成模型引入的倾向可以在语义检查中存活。
博主点评: 本文揭示了合成数据在代理模型训练中的潜在风险,强调了生成过程对模型行为的深远影响。简单的动作过滤无法解决根本问题,未来的研究应关注生成模型的设计与优化,以提升合成数据的安全性。