NeFut Logo NeFut
EN 管理员登录

[AI学术] TwinCheck:基于证据的负向双胞胎验证用于有状态工具代理

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#algorithm #AI #Machine Learning

单个看似合理的工具调用可能导致本应成功的代理轨迹偏离。仅凭怀疑并不足以触发干预,因为替换本身可能引入验证试图防止的错误。TwinCheck 在推理阶段引入一种验证策略:仅当轨迹满足与本地失败假设相关的证据条件时,才考虑替换。它构造一个基于轨迹的反事实备选,即负向双胞胎(negative twin),并在负向双胞胎通过结构检查且配对验证器在两种候选顺序下均偏好它时,才替换代理的原始提议。

为了进行配对评估,Exact Replay 将代理的解析响应和动作固定,直至首次接受的替换发生,从而将干预效果与重新采样区分开来。对 159 个多轮 BFCL V4 任务的完整 Exact‑Replay 配对进行主分析时,完整策略将 GPT‑5.6 Sol 的任务成功率从 45.3% 提升至 58.5%(95% 任务自助抽样置信区间 [8.2, 18.8]),且未观察到成功转为失败的回归。

这些结果将执行边界修复重新表述为受约束的比较,使得反事实动作本身成为验证对象。

点评

原文链接: https://arxiv.org/abs/2609.26911

[h] 返回首页