NeFut Logo NeFut
EN 管理员登录

[AI学术] ARBIGRAPH:可验证的可扩展任务图评估工具

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Open Source

我们介绍了 ARBIGRAPH,一个用于评估工具辅助语言代理在扩展推理工作流中是否能够保持、更新、组合和丢弃与任务相关上下文的基准生成器。ARBIGRAPH 将每个任务表示为一个可执行的 Python 求解器的自然语言问题,并通过类型化的中间状态(在这里实例化为标量和值列表)组合任务。

这种设计使得可控的任务图得以实现,其长度、依赖结构、干扰项数量和数值类型可以变化,同时保持精确的自动验证。我们用数学、GSM 风格的文字问题和 Python 跟踪任务类别实例化了 ARBIGRAPH,并评估了 Qwen3.5-27B 工具辅助代理在四种拓扑结构上的表现。

结果显示,在孤立任务上的准确性很高,但在更复杂的依赖任务上却有显著下降:在依赖数学任务的分支链上,准确性下降最高达 33.3%。这表明 ARBIGRAPH 揭示了单任务评估中不可见的失败。我们的代码、生成的数据集和评估结果可在 GitHub 上获取。

博主点评: ARBIGRAPH 提供了一种创新的方法来评估语言代理的上下文管理能力,通过引入可变的任务图结构,研究复杂任务的依赖关系,显示出工具辅助代理在处理复杂场景时的局限性。这对未来的研究和应用有重要的启示意义。

原文链接: https://arxiv.org/abs/2607.20764

[h] 返回首页