NeFut Logo NeFut
EN 管理员登录

[AI学术] NAQD 环境:语言代理的选择性撤回基准

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #LLM #Open Source

语言代理在证据变化、权限撤销或收到停止指令时,需要能够修改原计划的行为。理想的响应是选择性地暂停受影响的动作,保留未受影响的工作,并在完成必要修复后恢复。

为此我们提出 NAQD‑Env,一个合成环境,通过显式的证据、授权和约束依赖,对照确定性的参考策略进行评估。环境提供十一类依赖族,可在开发结构、未见结构以及结构组合的保持集上进行测试。

指标区分尝试违规与被模拟执行门允许的违规,并同时报告策略一致性、任务价值、撤回、恢复以及事件报告情况。我们在 350 条冻结场景上,对三种开源权重的指令微调模型(两大模型族)在三种提示条件下进行评估,共计 3 150 次模型‑提示交互,随后进行门重放。

结果显示,撤回召回率最高仅为 0.06,未在可恢复时出现有效恢复,完整匹配参考策略的情形仅有一次。在 NAQD 提示下,Qwen2.5‑7B 的不安全尝试次数少于 Qwen2.5‑3B 与 Llama‑3.1‑8B,但其完成的有用工作更少,且对未受影响动作的保留准确度也较低。进一步的监督微调实验将 Qwen2.5‑3B 的决策准确率从 0.45‑0.54 提升至 0.83‑0.92;但诊断显示在课程遗漏后出现不当撤回,并导致事件报告能力下降。

这些发现表明,选择性撤回应作为代理可靠性的重要独立评估维度。该设置使用可信的结构化输入测量策略执行,并不等同于真实世界的安全围栏或来源验证能力。

点评

原文链接: https://arxiv.org/abs/2609.38460

[h] 返回首页