随着大语言模型(LLM)能力的提升,AI 系统的长期价值不再局限于单次请求的解决,而在于将经验和累积的知识转化为持久、可复用的能力。我们提出 SimSkill,这是一种围绕城市交通仿真平台 SUMO(Simulation of Urban MObility)构建的自我进化代理。
SimSkill 能够自动识别自身的能力缺口,基于环境生成并求解任务,通过动作‑批评(action‑critic)循环验证解答,并在不更新底层模型的前提下,将经验整合进三类记忆:情景记忆、过程记忆和语义记忆。通过自主探索,它逐步构建起覆盖交通仿真工作流的可复用库。
我们在两个未见的基准上使用三种不同的骨干 LLM 进行评估,并采用独立的制品验证手段。实验表明,SimSkill 能将验证通过率提升至多 25 个百分点。消融实验显示,过程记忆和语义记忆对提升效果互补。记忆的收益受模型规模和预算限制影响:并非所有模型都能从记忆中获益,也并非所有情况下都能显著降低推理成本。
更广泛地说,SimSkill 展示了一种设计范式:自然语言用于保存和组合计算能力,而可执行工具和代码提供精确且可复现的执行方式。所有代码和实验数据已公开发布,地址为 https://github.com/qiliuchn/SimSkill-V1。
点评