NeFut Logo NeFut
EN 管理员登录

[AI学术] 保持任务专注:长时程智能体可靠性的基础测试

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

长时程的智能体工作流要求模型在上下文不断增长、子任务复杂度变化以及新数据到来时,能够持续执行依赖状态的操作。每一种情形都对应着智能体可能失效的独立维度。例如,一个需要对长账本进行对账的智能体必须反复读取状态、更新正确记录,并在数千次输出中保持对齐。模型虽然能够接受完整账本,却可能在生成过程中失去位置或停止一致地应用操作。为此我们提出 Long-Transduction,一种受控诊断方法,用于测试模型在长序列生成期间保持任务专注的能力,同时持续读取、变更并输出依赖输入上下文的操作,如算术、排序、变量查找和表格转换。Long-Transduction 通过独立变化局部任务复杂度、输入数据格式和上下文长度,来分离各轴上的失效原因。我们在七个开源权重模型上进行评估,发现当上下文长度从 4K 扩展到 128K 时性能下降 $62.8\%$,当输入格式变化时下降 $36.5\%$,而局部任务复杂度提升导致下降 $39.9\%$。这些失效在长时程智能体工作流中构成关键风险。

点评

原文链接: https://arxiv.org/abs/2609.38712

[h] 返回首页