我们提出 State-Grounded Conditioning(SGC)作为一种设计原则,针对需要依据实时用户状态(如游戏进度、会话历史、实时库存)的 LLM 代理。SGC 将状态相关的控制抽象为结构化输入上的规则内核,并通过 感知(Perception)、落地(Grounding)、交互(Interaction) 三层包装器实现显式的条件依赖。与此同时,我们定义了一个新的失效类别——方向漂移,指的是任务已完成但所选方向与当前状态不匹配的情况。
在实验中,我们使用了一个匿名化的 200 场对局基准(约 $1,000$ 条助理模型交互),该基准来源于一款游戏内对话教练,负责在连续的竞技比赛中为玩家提供指导。我们测量了平均首 token 延迟以及五项人工标注的对话质量指标,这些指标共同覆盖事实落地和教练式指导的进展程度。
感知包装器 将平均首 token 延迟保持在 $1.5\text{s}$,而在生产环境下的 PE-Agent 则需要 $6.1\text{s}$。在全部三层包装器启用的情况下,回合级别的落地准确率从基线的 $61.1\%$(Prompting)/ $69.8\%$(PE-Agent)提升至 $96.7\%$,会话级别的落地准确率从 $20.0\%$/ $26.5\%$ 提升至 $83.5\%$。相较于最强基线,会话级别的落地失效事件下降约 $78\%$。
累积消融实验表明,三个包装器的加入带来了互补的增益,尽管尚未证明每个包装器的独立效果,但结果支持了状态切片的近似正交性假设。
点评