在多步骤工程和信息工作流中,越来越多的大型语言模型(LLM)代理实现了自动化,但它们很少询问任务实际需要多少努力。代理通常采用最大上下文优先策略——重新阅读它们已经查看过的文件和依赖项,这使得一次简单的编辑变成了小规模代码审计。我们认为缺失的能力是任务感知执行范围估算:判断任务的难度、其真正需要的信息,以及在投入预算前的最短可靠路径。
我们形式化了最低充分执行和代理认知冗余比(ACRR),并提出了E3(估算、执行、扩展):代理先估算初始操作点,执行最低可行路径,只有在验证失败时才扩展范围。在MSE-Bench——一个包含121次编辑的确定性基准测试中,E3与最强基线的成功率达到了100%,同时成本降低了85%,令牌数量减少了91%,检查的文件数量减少了92%;并且比强大的自适应检索基线高出16%;这些增益在保持的指令措辞和几乎所有成本权重下都能持续。一个伴随的真实模型工具(LLM-Case)验证了E3在实时gpt-4o代理编辑真实开源库中的效果,每个候选补丁通过实际运行项目的pytest套件与测量的oracle进行评分:过度阅读的情况较轻但真实,E3是最精简和最快的策略,且任务成功率相当——唯一的短板是提供者的速率限制,而非错误编辑。
我们将此框架视为对执行冗余的控制探测,而非对任何部署代理的测量,并将任务感知执行定位为迈向工程基础人工智能(EGAI)的步骤——其努力基于任务的工程现实。我们发布了该框架和基准。
博主点评: 本文提出的E3框架有效地降低了AI代理在执行任务时的冗余,显示出在复杂性感知推理方面的重要进展。这为高效的AI应用提供了新的思路,尤其是在工程领域,值得关注其实际应用效果。