摘要
基于大规模语言模型(LLM)的游戏代理在复杂任务中表现不佳。本研究探讨这些失败是否与空间推理能力有限有关,并评估因果提示增强和多步规划是否能在管理响应延迟的同时提高胜率。
使用开源的 Qwen3 模型系列,我们在不同的模型规模、推理模式和规划视野下进行了实验。此外,我们还引入了一个专注于空间导航的 GVGAI 基准,由三个自定义游戏和五个难度级别组成。
评估遵循两种范式:首先是“定位实验”,测试代理找到其确切坐标的能力;其次是游戏成功率的研究。结果表明,虽然启用思考模式的较大模型能够更准确地识别其位置,但较小模型在坐标匹配方面的整体表现仍然有限。随着游戏级别和布局复杂性的增加,胜率下降,验证了基准的难度缩放。
将因果上下文集成到提示中通常能提高代理的成功率,尤其是对于较大模型而言。启用思考模式和更长的规划视野显著提高了性能,而多步规划进一步减少了平均每步响应时间,提供了推理深度与执行速度之间的实用权衡。
博主点评: 本文深入探讨了空间推理在 LLM 游戏代理中的关键作用,强调了因果推理和多步规划对提升模型性能的重要性。这为未来的模型优化提供了实用的方向,值得关注。