实时策略(RTS)游戏要求智能体在长时间对局中同时管理经济、生产、建筑、防御、部队编制和攻击时机。已有研究利用大语言模型读取文本化的游戏状态并输出高层计划,但推理延迟常导致错失关键战术时机;此外,完整对局的复杂性和战术多样性使系统高度依赖手工编写的经验提示,缺乏从历史对局中持续学习的能力。
我们提出 STRATA,一个角色对齐的层级系统,针对《红色警戒》实现跨局自学习。系统将决策划分为三类:Strategic Agent(SA)负责全局战略指令,Logistics Agent(LA)处理资源调度与建造,Tactical Agent(TA)执行部队微操与进攻。对局结束后,Review Agent(RA)从游戏轨迹中抽取候选经验,利用后续对局的证据进行验证和修正,并将跨局验证通过的经验压缩为简洁的经验卡供 SA 检索使用。
经验卡的形成过程包括:① 从完整对局日志中提取关键状态-动作对;② 在后续对局中检验这些对是否提升了胜率;③ 通过聚类与抽象合并相似经验,生成可快速检索的卡片。
实验在固定场景下进行对比:未使用经验卡时胜率约为 30%,加入学习得到的经验卡后胜率提升至 100%。进一步的顺序学习实验让 STRATA 与不同风格的 AI 对手交锋,系统能够分别捕获防守型、侵略型和经济型的长期战略经验,表现出显著的策略多样性。
这些结果表明,角色对齐的层级代理结合赛后自学习机制,能够在保持实时响应的同时实现持续的策略进化,为 RTS 游戏中的通用 AI 提供了一条可扩展的路径。
点评