NeFut Logo NeFut
EN 管理员登录

[AI学术] DecoEvo:解耦求解器与评分生成器技能的协同进化

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #optimization

摘要

文本空间优化通过编辑外部自然语言文档而非模型权重来调整大型语言模型(LLM),使得优化后的文档可供检查,模型本身则被视为黑箱。然而,现有的大多数文本空间方法保持评估固定。在开放式任务中,这可能成为瓶颈:一旦求解器在评分标准上有所提升,未被考虑的维度将对优化信号隐形。简单地演化评分标准也不可靠,因为更新是基于当前求解器的得分,表面上的进展可能只是因为使评分标准更易满足。

我们提出了DecoEvo(解耦协同进化),该方法在没有使用标准评分的情况下,解耦地共同演化求解器技能和评分生成器技能。求解器技能通过标准级反馈进行更新,而评分生成器技能则通过独立于整体求解器得分的要求覆盖和响应区分的互补审计进行修订。这种分离使生成器更新专注于新暴露的求解器弱点,减少对求解器已满足的标准的重复强调。

在每个基准的官方评估下,DecoEvo在五个基准和三个LLM骨干网络中超越了所有比较方法,在五个基准的平均值上实现了相对提高2.8%至5.0%。

博主点评: DecoEvo通过解耦求解器与评分生成器的更新策略,有效解决了开放式任务中评估固定带来的瓶颈,展现了其在提升求解器性能方面的潜力。这一方法不仅提高了模型的适应性,还为LLM的优化提供了新的思路,值得深入研究。

原文链接: https://arxiv.org/abs/2607.25675

[h] 返回首页