NeFut Logo NeFut
EN 管理员登录

[AI学术] ContractRL:可审计的工具调用修复的盾式组相对策略优化

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

Structured tool calls 在字段违背 schema 或执行合约时常会在少量字段后失效。完整对象的重新生成会扩大动作空间,导致重复修复难以审计。为此我们提出 ContractRL,一种受合约约束的顺序修复协议,将 verifier 引导的 JSON 修复建模为有界决策过程。每一步策略的输入包括候选对象、类型化的 verifier 反馈、JSON Pointer、不可变的修复历史以及剩余预算;合约衍生的动作掩码会过滤掉格式错误或被 RFC‑6902 禁止的操作,随后由确定性验证器执行状态转移。我们在保持 canonical 目标和语义标签在在线状态之外直至轨迹冻结的前提下,定义了针对 patch、retry 与 abstention 的组相对目标。实验在 192 条每种种子、五个随机种子的数据上进行比较:在相同的 verifier 信息下,ContractRL 达到 0.9362 的语义成功率,仅使用 34.4 个生成 token;而 Patch‑SFT 为 0.9076 与 44.9 token,完整重生成为 0.9148 与 137.2 token。通过策略优化,监督学习的 ContractRL 从 0.9186 提升至 0.9375。三种子种子配对评估显示相较 Patch‑SFT,语义提升 $+0.0396$(95% CI $[+0.0137,+0.0662]$, $p=0.0039$)。进一步的反馈、动作掩码、预算以及 schema‑shift 分析表明收益来源于局部纠错;对抗性和多轮评估则揭示了剩余的失效模式。

点评

原文链接: https://arxiv.org/abs/2610.00328

[h] 返回首页