NeFut Logo NeFut
EN 管理员登录

[AI学术] DeReAct:分解推理与行动的可靠 AI 代理

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

DeReAct 提出一种模块化的代理架构,摆脱了传统 ReAct 中单一 LLM 策略同时负责生成动作、与环境交互以及判断任务完成的耦合。系统将两类门控策略外部化:Critic 用于在动作执行前验证其合法性,Context Manager 负责重建由环境支持的 \textsc{State} 并对任务是否完成进行认证。这样可以独立控制动作授权和完成判定,防止错误传播和不受支持的提前终止。

在 GAIA 和 SWE-bench Verified 两套基准上,DeReAct 对弱模型的 Pass@1 提升最为显著。对 Qwen3-Coder-480B 提升约 6.5–7.0 分,对 Claude Sonnet 4.5 提升 4.2–5.2 分;随着 Brain 能力增强,提升幅度逐渐减小。轨迹和消融实验表明,当目标错误足够常见且门控策略本身足够可靠时,外部门控能够显著降低失败率。使用 Claude Opus 4.5 时,Pass@1 与 ReAct 相当,但 DeReAct 生成的轨迹在证据完整性和约束满足上更好,说明完成控制可以在更早终止与更强 grounding 之间进行权衡。

总体来看,DeReAct 在提升弱代理性能的同时,随着模型能力提升仍能保持对环境的扎实 grounding。

点评

原文链接: https://arxiv.org/abs/2610.02351

[h] 返回首页