NeFut Logo NeFut
EN 管理员登录

[AI学术] COVENANT:自然语言工作流编译与对齐代理执行的革命

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#algorithm #AI #Machine Learning

摘要

大型语言模型(LLM)代理越来越多地被委托执行自然语言工作流指令(例如,零售支付政策),这些指令不仅指定了要达成的结果,还规定了允许的步骤、分支和工具交互。然而,当这些指令作为提示上下文提供时,模型在程序选择和步骤执行上仍然保持控制。随着交互的积累,代理可能会跳过必要步骤、采取不支持的分支,或者用不支持的参数或效果执行有效步骤——我们称之为工作流不对齐的失败模式。

在这项工作中,我们提出了 COVENANT,一种工作流对齐代理执行的编译器和解释器架构。我们的关键见解是将工作流指令视为源程序而不是提示。COVENANT 将指令转换为工作流抽象语法树(WAST),并降低到工作流控制流图(WCFG)。在运行时,控制器逐个节点地解释 WCFG,检查每个提议与指令中提取的要求是否一致,然后再提交控制器状态或推进图,并返回用于修复的诊断反馈。

为了评估 COVENANT,我们使用了来自三个现有基准的 120 个案例,涵盖七种工作流场景。与最先进的 LLM 代理相比,COVENANT 将基准成功率从 50.00% 提高到 83.33%,并将工作流不对齐失败率从 42.50% 降低至 15.83%(相对降低 62.75%)。这些结果表明,COVENANT 实质性地缓解了工作流不对齐问题,使 LLM 代理的对齐从孤立的提示跟随向复杂多步骤工作流的可靠执行迈进。

博主点评: COVENANT 的创新之处在于将工作流指令视为源程序,显著提高了 LLM 在复杂任务中的执行可靠性。通过将指令转化为结构化的控制流图,COVENANT 不仅提高了成功率,还有效减少了错误,展示了未来智能代理的潜力与方向。

原文链接: https://arxiv.org/abs/2607.25400

[h] 返回首页