NeFut Logo NeFut
EN 管理员登录

[AI学术] COBRA-Skills:基于上下文赌博机的进化式代理技能优化

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#AI #optimization #LLM

大型语言模型(LLM)代理可以通过从已有任务经验中提炼可复用的技能来提升性能,但传统的技能优化方法往往依赖高成本的执行评估和大量任务数据。为此我们提出 COBRA‑Skills,一个将技能优化建模为预算受限的顺序优化过程的高效框架。框架核心是将 上下文赌博机(contextual bandit) 用于候选技能的优先级排序,并结合 基于证据的技能进化(evidence‑grounded skill evolution),在执行反馈的驱动下有选择地分配评估资源,仅对潜在有价值或信息量大的候选进行评估,同时不断更新技能集合。

在六个异构代理基准和三种目标模型上进行实验,COBRA‑Skills 始终取得所有对比方法中最高的平均表现,并将优化成本相较于 SkillOpt 降低了 55%–58%。此外,框架仅使用每个基准 50 条唯一的优化示例即可实现上述效果。进一步分析表明,COBRA‑Skills 对代理实现的变化具有鲁棒性,并且在目标模型本身用于技能生成和细化时仍能保持有效。

点评:COBRA‑Skills 通过将预算约束、上下文赌博机决策和执行反馈紧密结合,实现了高效且稳健的技能优化,为大规模 LLM 代理的可复用技能库构建提供了可行路径。

原文链接: https://arxiv.org/abs/2609.11682

[h] 返回首页