在大型语言模型(LLMs)推动下,越来越强大的对话代理应运而生,但在实时交互环境中可靠地控制其行为仍然是一个重大挑战。现有的方法通常依赖模型微调或对齐程序,这些方法难以适应不断变化的交互需求。
本文介绍了一种分层的场景驱动LLM控制框架,该框架通过结构化提示实现运行时行为控制。通过将持久上下文与特定场景约束结合,该方法允许在交互过程中修改代理行为,而无需改变底层模型。
该框架在ARDena中实现,这是一个实时多模态具身代理,集成了语音交互、视觉感知、工具使用和基于虚拟形象的响应生成。提出的方法在控制有效性、响应延迟和操作稳定性方面进行了评估。结果表明,仅通过场景定义就能产生显著不同的交互行为,同时保持稳定的实时操作,突显了场景驱动提示在控制LLM代理中的有效性。
博主点评: 该研究展示了如何通过场景驱动的提示机制来增强LLM代理的灵活性与控制力,尤其在动态交互环境中,能够有效应对变化的需求,具有重要的应用前景和研究价值。