NeFut Logo NeFut
EN 管理员登录

[AI学术] SkillEvo:基于多轮交互反馈的自我更新演化梯度

发布于:2026-08-15 22:00 最后更新:2026-08-16 07:03
#AI #Machine Learning #LLM

SkillEvo 是一个基于多轮交互反馈的自我更新演化梯度方法。传统的智能体技能都是手动编写或单次生成的,没有一个闭环来改进它们从交互失败中造成的缺陷。最近的工作虽然关闭了这个循环,但是只使用单轮问答评估来获得反馈。因此,存在一个明显的不对称性:一旦第一次修复了单次交换可以揭示的缺陷,演化梯度就会衰减,多次交换中出现的缺陷将保持不可见,演化就会停滞。SkillEvo 通过两个组件来解决这个问题:第一,多轮用户模拟从评估端点转变为反馈生成器;第二,独立的治理层来主动修复事实退化和结构膨胀。实验结果表明,SkillEvo 在六个云服务类别、9 个生产技能和 98 个技能参考文件中,超过基于自我反思的演化 23.0 分,超过单轮问答驱动的演化 15.4 分。 博主点评: SkillEvo 是一个很有前景的方法,通过多轮交互反馈来更新演化梯度,可以有效地改进智能体技能的缺陷。这个方法的关键在于,将多轮用户模拟转变为反馈生成器,并使用独立的治理层来修复事实退化和结构膨胀。这个方法可以应用于多个领域,包括云服务、自然语言处理等。

原文链接: https://arxiv.org/abs/2608.13120

[h] 返回首页