NeFut Logo NeFut
EN 管理员登录

[AI学术] 空间策略而非动作:向量量化测地线作为 LLM 驱动代理的工具

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#algorithm #LLM #Artificial Intelligence

大型语言模型(LLM)驱动的智能体常被指缺乏空间感知,倾向于利用统计文本模式。为评估其空间理解能力,我们在网格世界环境中构建了一套几何工具与 LLM 高层调度相结合的体系结构。

离线阶段:智能体在环境中采集大量测地线轨迹,这些轨迹通过向量量化(VQ)压缩为一组具代表性的子集。随后,LLM 为每条选中的轨迹生成自然语言描述,形成可供调用的“工具”。

在线阶段:在给定当前状态和目标的条件下,LLM 选择最合适的工具;低层控制则交由原始动作执行所选工具对应的轨迹。

从代理 AI 的视角看,这种设计将学习划分为两层:

我们在一个部分可观测、动态的二维网格环境中进行实验,使用开源视觉语言模型 Qwen3.6-35B-A3B。将几何生成的工具库与“视野放大”工具和碰撞检测工具组合后,即使在不进行链式思考的快速配置下,也能达到与高成本链式思考版本相同的目标达成率,同时将单次决策时间从分钟级降至秒级。

实验结果显示,工具库的离线构建成本一次性付出,而在线推理成本极低,证明了空间策略的可行性与效率。

点评

原文链接: https://arxiv.org/abs/2610.00613

[h] 返回首页