随着 AI 智能体在长时程任务中的广泛部署,产生了海量的执行日志。要提升系统可靠性,必须从这些记录中诊断失效原因,将结果层面的信号转化为可执行的干预措施。由于日志规模庞大,人工审阅几乎不可能,这推动了自动化根因归因(RCA)的需求。现有基于大语言模型(LLM)的 RCA 方法在诊断准确率上表现不佳,尤其是当执行轨迹变长时。信息往往稀疏、分散在相距甚远的动作之间,并且与可见的失效结果脱节,使得根因归因本质上成为一次大规模搜索。传统方法通常采用一次性 LLM 判决,从完整轨迹中直接给出诊断。虽然在短轨迹上有效,但在长轨迹中,判决往往过早收敛,导致关键证据被忽视。为此我们提出 持续搜索(Continual Search) 框架:通过多轮交互不断提示判决器继续寻找未解决的诊断证据。我们在四个已有 RCA 基准上进行评估,并针对当前基准缺乏大规模执行轨迹的问题,构建了 MegaRCA‑Mix,该数据集包含 50 个人标注的长时程、执行密集型任务失效案例。实验表明,持续搜索在多个基准套件和模型族上均显著提升归因性能。例如,在 MegaRCA‑Mix 上,GPT‑5.5 的 F1 分数从 $0.349$ 提升至 $0.498$,增幅超过 40%。更有趣的是,同一模型族中,低阶模型在使用持续搜索后甚至可以超越高阶模型,说明有效的搜索策略比模型规模本身更关键。
点评