NeFut Logo NeFut
EN 管理员登录

[AI学术] DynSTEER:面向智能体的动态分阶段轨迹评估与执行时审查

发布于:2026-09-15 22:00 最后更新:2026-09-16 00:22
#AI #Machine Learning #LLM

大型语言模型(LLM)智能体正被用于执行长时程任务,但现有评估方式存在三大缺陷:仅在终点打分忽视中间过程,难以高效定位错误;单一参考匹配会惩罚合法的替代解法;事后轨迹评判成本高且无法提前终止失败运行。为此我们提出 DynSTEER——一种动态分阶段轨迹评估框架。DynSTEER 将完整 rollout 划分为若干关键动作完成后的阶段,在每个阶段提供足够上下文的里程碑评估,并据此进行策略微调。框架从公开任务视图构建容错里程碑图,既容纳多种合法策略,又不泄露真实答案。评估查询会自适应地在多层裁判之间路由,遇到不可恢复的执行时即时中止,以降低资源浪费。实验表明,DynSTEER 相比原生评估提升 85.2% 的判别能力,所有模型配对均达到统计显著差异,并在失败 rollout 上节省 34.51% 的执行步数。

点评

原文链接: https://arxiv.org/abs/2609.14637

[h] 返回首页