工具调用型大语言模型(LLM)代理正被广泛部署在企业场景中,但要对其进行有效评估和优化,需要高质量且多样化的任务数据集。受限于隐私等因素,这类数据往往难以获取。现有的合成任务生成方法通常只产生通用任务,忽视了代理的内部状态或数据库,难以覆盖真实使用中的多样性。\
我们提出 EdgeGen,一个合成任务生成框架。它首先从代理的规格说明中抽取合规规则,然后基于这些规则在数据库层面生成旨在违背规则的边缘案例任务。将 EdgeGen 生成的任务与传统的合成数据相结合,可用于对代理进行微调(finetuning)或 harness 优化,实现全自动闭环,无需人工标注。\
在 tau2bench 航空领域的实验中,对 EdgeGen 生成的数据进行微调,使模型的平均进度提升了 2% 到 42%,而其他基线方法在部分模型上出现性能下降。针对 harness 优化,EdgeGen 相比人工策划的 harness 提升约 10%,相对基础 harness 提升约 30%(以 Gemma-4-e4b 为例)。\
点评:EdgeGen 通过规则驱动的边缘案例合成,显著提升了工具调用代理在非理想路径下的鲁棒性,为构建安全可靠的企业级 LLM 系统提供了可行的自动化方案。