NeFut Logo NeFut
EN 管理员登录

[AI学术] DeFA:基于依赖的LLM代理错误归因框架

发布于:2026-10-03 22:00 最后更新:2026-10-06 12:11
#Machine Learning #LLM #Artificial Intelligence

DeFA 通过构建事件依赖图,将协议关系和语义依赖统一到一个跨轨迹的图结构中。首先,它在执行轨迹上识别可能违背任务要求的事件,并追溯这些事件的来源及其后续影响,形成错误传播图。随后,利用步骤证据以及各步骤在传播图中的角色,定位决定性错误、责任代理以及错误类别。

为处理长轨迹,DeFA 将执行划分为若干段,并将当前段的详细内容与其他段的摘要相结合,使局部诊断能够访问全局上下文。

在 Who and When 与 Who and When Pro 子集上,DeFA 在所有评估的骨干模型中实现了最高的责任代理和精确步骤定位准确率,并在 Pro 子集上取得了最高的错误模式准确率(对齐分类法的最佳表现)。进一步的图像和视频轨迹实验表明该方法同样适用于多模态错误归因。

消融实验验证了分段策略、事件依赖图和错误传播图的贡献。将 DeFA 的诊断反馈用于 Trace2Skill 的技能演化,可使下游任务准确率提升 6%~15% ,说明诊断结果还能促进后续任务的代理改进。

点评

原文链接: https://arxiv.org/abs/2610.01256

[h] 返回首页