在大型语言模型(LLM)代理中,验证-修复循环是纠正代码生成、数学推理和工具使用中错误计划的标准方法。然而,当验证者和修复者都存在噪声时,修复可能会破坏已经正确的计划,导致报告的接受度不断上升,而真实有效性却在下降。因此,现有方法缺乏一个原则性基础来决定何时应停止修复。
我们提出了 VRR-Stop,一个针对噪声验证-修复-重复(VRR)循环的鲁棒停止框架。该框架使用四参数噪声模型,将验证者的虚假接受和虚假拒绝与修复者的修复和损害行为分开。信念过滤技术将重复的验证投票转化为对承诺有效性的估计,循环根据真实边际增益的符号进行承诺或修复,这仅需要符号可识别性,而不需要准确恢复所有参数。
当验证者的区分度接近零时,校准本身会失败,估计误差可能会翻转停止符号,因此我们将 VRR-Stop 与 VRR-Guard 配对,后者在足够的验证边际下仅替换现任候选者,而不需要估计。
在 GSM8K 压力测试设置下,VRR-Stop 在平均 0.72 次修复轮次的成本下,将最终真实有效性提高了 60.6 个百分点。各个设置下,停止的可靠性由验证者的区分度和决策边际共同决定,而不是绝对的估计误差大小。
博主点评: VRR-Stop 通过引入信念过滤和噪声模型,显著提升了 LLM 代理在不确定环境中的决策能力,展现了在复杂任务中处理噪声的潜力。其与 VRR-Guard 相结合的策略为后续研究提供了新思路,值得深入探讨。