NeFut Logo NeFut
EN 管理员登录

[AI学术] 何时让步:文本嵌入式代理的纠正仲裁

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

本文探讨当使用者的纠正可能错误时,具身代理应如何响应。我们将此问题定义为基于事实的纠正仲裁,其选择包括接受、拒绝、检查环境以及向说话者提问。为实现该接口,GAVA 采用了观察受限的证据收集、合法探测以及一步期望损失规则。

在仅文本的 ALFWorld 环境中,我们设置了 162 个检查点,产生 972 对真假干预。完整的局部检查使 GAVA 能够始终验证 100% 的纠正准确率,从而实现证据契约,而非相对优势。

在同一回合执行时,GAVA 相比于始终验证的策略显著降低了交互成本,但在完美说话者的情况下仍受成本阈值限制。进一步引入仅用于训练的对象位置先验,可在 340 个未见场景中将交互成本和声明的联合成本分别降低 0.490 和 0.420(相对于均匀 GAVA)。

冻结策略后,在 77 个不重叠的已见检查点(覆盖 308 场景)上复现了收益:交互成本降低 0.595,联合成本降低 0.517,且 95% 检查点自助置信区间均不包含零。联合成本同等先验的固定策略亦有提升,而与校准后的无价值信息比较仍不确定。

语义 GAVA 在每个实验组中出现四个事实错误,对应的准确率分别为 98.8% 和 98.7%,所有方法均完成了全部任务。结果支持在声明成本下使用语义先验进行选择性信息收集,但未能证明环境信息价值(VOI)相较于澄清具有普遍优势。研究使用归一化声明、完整符号观测和受控说话者,不涉及人类参与、视觉输入或实体机器人。

点评

原文链接: https://arxiv.org/abs/2610.00282

[h] 返回首页