NeFut Logo NeFut
EN 管理员登录

[AI学术] 工具使用代理的调用级可靠性分析

发布于:2026-08-29 22:00 最后更新:2026-08-30 12:07
#AI #Machine Learning #LLM

工具使用代理会以两种方式失效:选错工具或形成错误论证。任一早期失误都可能在后续步骤中悄然传播,导致整体任务崩溃。我们在五个开源权重模型上,对无污染的多步任务(深度 1‑8)测量了正确调用率,分别在教师强制的干净上下文和模型自行自由运行的上下文下进行。结果显示,深度达到 6 时,模型在自由运行上下文中约有 70% 的原始能力被自身早期错误侵蚀($L_6 = 0.686$, $L_6 = 0.684$)。

核心发现聚焦于测量本身。使用对固定金标准轨迹的精确匹配评分时,传播模型的严重度恢复率参数不仅难以估计,甚至被评分规则固定。严重度被迫为边界值(869 步中 0 步正确),恢复率在结构上不可观测(580 步中 0 步回到正轨,理论随机期望为 0.0058)。这源于一个机制:在模型偏离后,金标准值由模型从未见过的工具常量生成,信息对模型不可得。即便如此,拟合仍返回 0.92 与 0.73,虽然真实值恰为 1.000——即评分规则已经决定了参数值,却仍给出高置信度数字。

我们提出了解决方案——条件状态评分(conditional‑on‑state scoring),可对已缓存的完成结果进行后处理,零额外成本地解除严重度对零的固定,使其在内部估计区间内波动(+0.149, +0.316)。

博主点评:本文揭示了常用精确匹配评分在多步工具使用任务中的盲点,并提供了实用的后处理方法,值得在评估框架中推广使用。

原文链接: https://arxiv.org/abs/2608.26189

[h] 返回首页