DeReAct 提出一种模块化的代理架构,摆脱了传统 ReAct 中单一 LLM 策略同时负责生成动作、与环境交互以及判断任务完成的耦合。系统将两类门控策略外部化:Critic 用于在动作执行前验证其合法性,Context Manager 负责重建由环境支持的 \textsc{State} 并对任务是否完成进行认证。这样可以独立控制动作授权和完成判定,防止错误传播和不受支持的提前终止。
在 GAIA 和 SWE-bench Verified 两套基准上,DeReAct 对弱模型的 Pass@1 提升最为显著。对 Qwen3-Coder-480B 提升约 6.5–7.0 分,对 Claude Sonnet 4.5 提升 4.2–5.2 分;随着 Brain 能力增强,提升幅度逐渐减小。轨迹和消融实验表明,当目标错误足够常见且门控策略本身足够可靠时,外部门控能够显著降低失败率。使用 Claude Opus 4.5 时,Pass@1 与 ReAct 相当,但 DeReAct 生成的轨迹在证据完整性和约束满足上更好,说明完成控制可以在更早终止与更强 grounding 之间进行权衡。
总体来看,DeReAct 在提升弱代理性能的同时,随着模型能力提升仍能保持对环境的扎实 grounding。
点评