NeFut Logo NeFut
EN 管理员登录

[AI学术] Rep2Skill:基于表征的技能自我进化框架

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #LLM #Open Source

文本技能让基于大语言模型(LLM)的智能体在不改动模型参数的前提下积累可复用的过程知识。现有的技能进化主要在文本层面进行:优化器只能依据完整的执行轨迹和稀疏的任务结果来诊断成功或失败,并据此修改技能。这种仅靠文本的方式忽略了智能体内部表征——这些表征记录了执行过程的细粒度状态。我们提出 Rep2Skill,一个利用内部表征进行技能自我进化的框架。具体做法是,在收集到的智能体 rollout 中,Rep2Skill 对模型内部表征序列进行建模,定位偏离成功执行动态的回合,并结合执行上下文将这些信号转化为可操作的文本反馈,用于针对性地修正技能。实验在两个智能体环境和两个开源 LLM 上进行,结果表明在自我进化设置下,Rep2Skill 始终优于仅使用文本的基线,即同一 LLM 同时充当执行者和优化器且无需更强的外部模型。该工作展示了超越文本反思的智能体自我改进新方向。

点评:Rep2Skill 有效把内部表征纳入技能迭代循环,提升了自我优化的深度和效率,为开放模型的自主学习提供了可行路径。

原文链接: https://arxiv.org/abs/2609.39149

[h] 返回首页