NeFut Logo NeFut
EN 管理员登录

[AI学术] 自进化算法设计代理:通过人口策划策略优化突破上下文进化停滞

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #optimization

大型语言模型正日益以算法设计代理的形式参与复杂真实任务,负责设计算法并进行迭代。现有多数成功的代理采用纯粹的上下文进化框架,但在需要专业知识的领域容易出现性能平台期。参数化适应能够将专业知识内化,却通常需要大量领域语料,而高质量算法在复杂设计算景中极为稀缺。

本文提出一种样本高效的参数化自进化方法,使代理能够从自行生成的算法中探索并学习。首先,我们对上下文进化停滞进行形式化描述,并提出改进链命题,证明学习一系列自生成算法可以局部提升相邻算法的出现概率。基于此局部转移视角,进一步提出人口策划策略优化(PCPO),利用全局人口和混合策略更新机制,保留并复用高质量且多样的自生成算法,将策略逐步迁移至更强的算法。

在电子设计自动化的全局布局学习率调度任务中,仅使用4个芯片案例进行训练,PCPO在16个芯片案例上的平均表现超越了最新的上下文进化方法(如OpenEvolve、ShinkaEvolve)。使用8B规模的基础模型时,PCPO的性能已可与前沿闭源模型(如GPT‑5.5)相媲美。PCPO通过内化领域知识和提示蒸馏,显著降低推理时的 token 消耗。

此外,PCPO在四个 GPU 核心设计上实现了显著加速,平均相较于 PyTorch Eager 基线提升 $8.27\times$。

点评

原文链接: https://arxiv.org/abs/2609.38757

[h] 返回首页