大型语言模型(LLM)正日益被用作自主代理,执行复杂且持续时间长的过程性技能。传统的代理运行时通过不断向对话历史中追加观察、动作和中间推理痕迹来维持执行,这会导致对话长度不断增长,进而出现延迟升高和上下文污染等问题。
SKILL.state 提出了一种全新的运行时架构:用显式的、可变的执行状态取代追加式的对话历史。每一步执行时,模型仅接收三类输入——不可变的技能规范、当前的结构化执行状态以及最新的观察信息。模型在生成经过验证的状态更新后立即丢弃中间推理,避免了提示随执行历史膨胀。
在多个数据集、不同模型以及多种执行环境的实验中,SKILL.state 显著提升了任务准确率,同时大幅降低了累计 token 消耗。实验结果表明,显式的执行状态是一种与具体实现无关、能够支撑长时程代理技能的有效抽象。
博主点评:SKILL.state 的设计思路简洁而有力,通过把状态管理外置,成功解决了长对话中的性能瓶颈,为未来构建更可靠的 LLM 代理奠定了基础。