NeFut Logo NeFut
EN 管理员登录

[AI学术] 结构化反馈显著提升LLM代理的修复能力

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#algorithm #AI #Machine Learning

在LLM代理系统中,外部验证拒绝候选项后,通常会进行重试,但验证与下一次模型调用之间的接口仍不明确。为此,我们引入了 VeriHarness,这是一个代码控制的代理循环,模型在其中生成候选项,而外部验证者控制接受度、预算和追踪。

我们利用 VeriHarness 比较了原始诊断与包含失败位置、观察值和可接受替代方案的反馈。在50场配对的 TextWorld 游戏中,反馈包含这三项内容使得 Qwen2.5-Coder-14B 的终局成功率从14/50提升到36/50(提高了44个百分点),Llama-3.1-8B 的成功率则从8/50提升到29/50(提高了42个百分点)。

消融实验显示,大部分增益来自于可接受的替代方案:仅提供位置和观察值的反馈几乎与原始诊断基线相同。将完整的修复信息以散文形式呈现,而非键值 JSON 记录,几乎产生相同的成功率,未能证明 JSON 语法本身提升了修复效果。这一顺序在测试的调用预算和一个采样解码设置中保持一致。

博主点评: 该研究展示了结构化反馈在提升 LLM 代理修复能力中的重要性,验证了信息的完整性对于成功的关键作用,为未来的模型优化提供了新的思路。通过有效的反馈机制,LLM 可以更好地适应复杂的环境,提高决策质量。

原文链接: https://arxiv.org/abs/2607.14167

[h] 返回首页