摘要
长时间跨度的战略规划在复杂的策略游戏中需要协调紧密耦合的决策领域,包括技术、经济、外交和军事,跨越数百个回合且信息不完备。现有的基于LLM的智能体在此环境下面临三个挑战:
- 它们从原始坐标观察中获取的关系结构(如距离或威胁)非常有限。
- 它们将整个不断增长的游戏状态序列化到每一个提示中,并在单一输出中规划所有领域,导致上下文溢出,紧急领域挤压长期领域。
- 唯一的奖励是滞后的最终得分,这在游戏内部或跨游戏之间提供的进展信号微乎其微。
我们提出了SAGA,一个LLM多智能体框架,通过三种机制解决这些挑战:
- 地图语义场景图:将类型化实体关系渲染为简洁的每实体文本。
- 工具增强规划器:按需检索状态并将不相交的每领域指令路由到专业控制器。
- 双重视野反馈循环:在游戏中设定中间目标,并提炼跨游戏的因果教训。
在以策略游戏FreeCiv为基础的基准CivRealm上,SAGA在六种方法中达到了最高的平均最终得分,在基础设施方面获得了统计上最强的提升,并减少了27%的输出令牌。通过启用跨游戏演化,它在五场连续游戏中达到了最高得分。
博主点评: SAGA的提出不仅有效应对了复杂策略游戏中的长远规划问题,更通过多智能体的协作与反馈机制,展示了LLM在动态环境中的潜力与灵活性,值得关注其后续发展与应用。