大型语言模型(LLM)驱动的智能体常被指缺乏空间感知,倾向于利用统计文本模式。为评估其空间理解能力,我们在网格世界环境中构建了一套几何工具与 LLM 高层调度相结合的体系结构。
离线阶段:智能体在环境中采集大量测地线轨迹,这些轨迹通过向量量化(VQ)压缩为一组具代表性的子集。随后,LLM 为每条选中的轨迹生成自然语言描述,形成可供调用的“工具”。
在线阶段:在给定当前状态和目标的条件下,LLM 选择最合适的工具;低层控制则交由原始动作执行所选工具对应的轨迹。
从代理 AI 的视角看,这种设计将学习划分为两层:
- 工具发现:通过无监督的轨迹量化完成;
- 推理与决策:由 LLM 完成。
我们在一个部分可观测、动态的二维网格环境中进行实验,使用开源视觉语言模型 Qwen3.6-35B-A3B。将几何生成的工具库与“视野放大”工具和碰撞检测工具组合后,即使在不进行链式思考的快速配置下,也能达到与高成本链式思考版本相同的目标达成率,同时将单次决策时间从分钟级降至秒级。
实验结果显示,工具库的离线构建成本一次性付出,而在线推理成本极低,证明了空间策略的可行性与效率。
点评