NeFut Logo NeFut
EN 管理员登录

[AI学术] StructAgent:驾驭长时程数字代理的统一因果结构

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#AI #Machine Learning #Open Source

最近,大型语言模型(LLMs)和视觉-语言模型(VLMs)的进展使得数字代理在计算机使用中变得愈发强大。然而,现实任务往往是长时程的,涉及到不断演变的上下文,包括累积观察、中间编辑、失败尝试和部分完成的执行。

现有代理通常在原始交互历史上操作,这使得任务进展难以解释、验证和恢复,从而限制了可靠的长时程执行。本文提出,解决这一挑战需要明确围绕任务进展的统一因果表示来构建代理的状态和工作流。

我们介绍了 StructAgent,一个以状态为中心的框架,旨在维护紧凑且可验证的任务进展,并通过验证者支持的状态转换来规范进展。基于这一设计,StructAgent 进一步支持明确的进展检查点、证据驱动的任务完成、针对性的失败恢复以及工具支持的执行,确保所有进展更新都基于验证。

广泛的实验表明,StructAgent 在长时程计算机使用任务上持续提升了多种 LLM 和 VLM 的性能。在 OSWorld-Verified 上,它将 Qwen3.5-9B 的成功率从 27.0% 提升至 46.9%,将 Qwen3.5-27B 的成功率从 31.6% 提升至 62.2%,同时以 78.9% 的新开源最佳成绩实现了 MiniMax-M3。此外,框架还超越桌面环境,推广至 Minecraft,展示了我们设计的通用性。

博主点评: StructAgent 的提出为长时程任务的执行提供了新的解决思路,通过统一的因果结构来提升数字代理的可靠性与可验证性。这种方法不仅提升了现有模型的性能,还展示了其在多种环境下的适用性,具有重要的研究价值与应用前景。

原文链接: https://arxiv.org/abs/2607.11388

[h] 返回首页