NeFut Logo NeFut
EN 管理员登录

[AI学术] 代理的衰减速度有多快?对生产决策中长时程LLM代理的实证研究

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #LLM

生产环境中部署的大语言模型(LLM)代理在长序列、多步骤工作流上仍然不可靠,尽管基准测试的成功率在稳步上升。我们认为,这一差距主要来源于任务时程:公开基准大多聚焦于短至中等时程,成功率保持较高,而真实生产任务往往需要数量级更多的依赖步骤。

我们直接测量了这一效应,开展了大规模受控实验,覆盖九种模型(包括六个开源模型,参数规模从 1.2B 到 671B)和三套商业系统,四类任务(其中包括真正的工具使用循环),五种时程长度以及三种上下文设置。实验结果显示,任务成功率遵循几何衰减规律,由单一步骤可靠性参数 $r$ 决定。$r$ 随模型规模提升而上升,但即使是最强模型也远未达到 1,意味着在足够长的时程上必然出现崩溃。

在代理任务上衰减最为显著:所有模型(包括广泛部署的系统)在 16 步内从接近完美的成功率跌至几乎为零(共分析 10,664 条轨迹)。进一步分析表明,衰减主要由步骤数量驱动,而非上下文长度:限制上下文窗口会加速衰减(对数几率斜率 -0.69 对比 -0.44,$p=3\times10^{-6}$),这与“中间丢失”假设相矛盾,也警示了常见的生产捷径。

将测得的可靠性投射到典型基准时程上,可量化基准与生产条件之间的显著差距:在 GAIA 长度时程上可靠性约为 0.42,而在百步生产时程上降至约 0.24。针对大规模代理编排与可靠性管理的团队,这些结果呼吁采用时程感知的评估方式和可靠性预算,而不是单纯的整体通过率指标。代码、提示、随机种子以及原始轨迹已全部公开。

点评

原文链接: https://arxiv.org/abs/2609.01660

[h] 返回首页