NeFut Logo NeFut
EN 管理员登录

[AI学术] MOAE:基于Pareto保留的多目标代理进化

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

随着基于大语言模型的代理不断进步,对其评估也日益多维:一个合格的代理不仅要在任务完成准确率上表现出色,还需在交互质量、安全性和效率等方面取得平衡,这提出了一个核心问题——这些目标能否同步优化?已有方法虽考虑了多目标,却往往将异构度量压缩为固定的标量分数。标量化依赖于度量归一化和偏好权重,容易丢弃那些在实际部署中具有价值的折中方案。\ \ 我们提出 Multi-Objective Agent Evolution (MOAE),将迭代的上下文微调组织为对完整代理 rollout 的 Pareto 保留进化搜索。给定有限的 rollout 预算,MOAE 维护一个经验档案,记录所有非支配(non-dominated)候选;利用针对每个目标的诊断信息引导子代生成;仅在部署阶段进行约束感知的选择。这样在搜索阶段保留候选,而在返回最终解时再依据偏好进行筛选。\ \ MOAE 不需要对模型参数进行更新,且每个目标可以替换为任意可测量属性。本文将其具体化为任务性能、轨迹质量和安全性三项指标。实验在 TravelPlanner 与 AgentDojo 两个基准上进行,结果显示在相同 rollout 预算下,MOAE 能持续提升任务性能和轨迹质量,同时保持强安全性。进一步的搜索行为分析表明,Pareto 保留能够扩展可达目标空间,并提升联合改进的频率。\ \ 这些发现证明了在搜索过程中不固定标量化、通过 Pareto 保留进行上下文进化的潜力,为多属性代理优化提供了新思路。\ \ 点评:MOAE 展示了在不预设标量化权重的情况下,通过 Pareto 保留实现多目标协同提升的可行性和优势。

原文链接: https://arxiv.org/abs/2609.05992

[h] 返回首页