大型语言模型(LLM)智能体正被用于执行长时程任务,但现有评估方式存在三大缺陷:仅在终点打分忽视中间过程,难以高效定位错误;单一参考匹配会惩罚合法的替代解法;事后轨迹评判成本高且无法提前终止失败运行。为此我们提出 DynSTEER——一种动态分阶段轨迹评估框架。DynSTEER 将完整 rollout 划分为若干关键动作完成后的阶段,在每个阶段提供足够上下文的里程碑评估,并据此进行策略微调。框架从公开任务视图构建容错里程碑图,既容纳多种合法策略,又不泄露真实答案。评估查询会自适应地在多层裁判之间路由,遇到不可恢复的执行时即时中止,以降低资源浪费。实验表明,DynSTEER 相比原生评估提升 85.2% 的判别能力,所有模型配对均达到统计显著差异,并在失败 rollout 上节省 34.51% 的执行步数。
点评