摘要
大型语言模型(LLMs)在决策和推理任务中越来越多地被使用,但它们作为物理系统控制器的潜力仍然未被充分探索。本文研究了LLMs能否作为动态热环境的可解释控制器,考察其遵循设定点、理解自然语言命令、推理执行器效果及融入先前模型知识的能力。
五种不同规模的LLMs在多种场景下进行了评估,包括对加热器或风扇使用的惩罚设置,以及模型访问基于物理的预测工具的情况。结果显示,控制性能依赖于模型复杂度:小型和中型模型常常错误解读执行器动态或产生不一致的推理,而高复杂度模型如Qwen-3~14B和GPT-4o则能实现准确的温度跟踪、稳定的执行器使用以及与物理原理一致的连贯解释。引入基于物理的模型显著提高了控制的平滑性和能效,使得模型能够进行前瞻性决策。
详细的推理分类进一步揭示了小型模型中的因果误解到大型模型中连贯且时序意识的推理的明显进展。这些发现表明,当LLMs具备足够的能力并适当扎根于领域知识时,可以作为可解释的控制器,突显了混合基于模型和语言驱动控制策略的有希望机会,这些策略能够提供合理的解释。
博主点评: 这项研究为大型语言模型在动态系统控制中的应用提供了新的视角,展示了模型复杂度对控制效果的显著影响。同时,结合物理模型的策略为未来的智能控制系统设计提供了宝贵的经验,值得进一步探索。