NeFut Logo NeFut
EN 管理员登录

[AI学术] 当智能体自我矛盾:行为一致性作为LLM智能体的不确定性信号

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#algorithm #AI #Machine Learning

摘要

运行相同的LLM智能体在相同输入下,每10次运行产生2.3-4.2个不同的动作序列;这种行为方差构成了一种无训练、黑箱的不确定性信号,为智能系统的选择性分类和无分布校准提供了基础。

在对200个HotpotQA问题进行的8000次运行中,任务一致性(最多2条独特路径)实现了82-87%的准确率,而不一致任务(4条或更多路径)则仅实现41-65%的准确率,这一差距在控制任务难度后仍然存在。

行为分歧主要集中在第2步(50.5%的Llama任务),一致性指标在检测失败时的AUROC为0.62-0.78。

利用这一信号,选择性预测(仅在k=3次运行一致时回答)实现了87-88%的准确率,覆盖率为54-62%,比单次运行基线提高了6-14个百分点,并且在没有保留校准集的情况下与分裂校准基线匹配。

对SWE-bench(50个任务,1000次运行)进行的跨基准验证保持了一致性层次,同时揭示了不同模型间平均轨迹长度的约8倍差异,bootstrap分析显示单次运行评估错误排名模型的概率为29.3%。

博主点评: 本文探讨了LLM智能体在相同输入下的行为一致性,揭示了这一不确定性信号对智能体性能的重要影响。通过选择性预测方法,研究者有效提高了模型的准确率,展现了行为一致性在智能体系统中的潜在应用价值。该研究为未来的LLM智能体设计提供了新的思路,值得关注。

原文链接: https://arxiv.org/abs/2602.11619

[h] 返回首页