NeFut Logo NeFut
EN 管理员登录

[AI学术] STOCKTAKE:测量LLM代理在感知与行动之间的差距

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#algorithm #Machine Learning #optimization

摘要

LLM代理在多周决策任务中的评估日益增多,这些任务的状态驱动成本从未直接观察到。在此类任务中,最终成本无法说明代理失败的原因:可能是误解了世界,或是正确理解但仍未采取行动(知行差距)。现有评估无法区分这两种失败;它们的参考策略要么读取代理从未看到的特权信息,要么根本不存在。我们引入了STOCKTAKE,一个为期26周的供应链补货基准,构建为一个具有六个隐藏因子过程的部分可观察马尔可夫决策过程,设计旨在使得公正参考策略可计算:每个因子的精确贝叶斯滤波器驱动与代理接收的相同观察流的滚动策略。每次运行的评分在无症状基础库存(0)和这个oracle(1)之间产生一个技能得分,而每周的书面推理评分则产生所述信念检测滞后和知行比率,从而分别测量状态估计和控制。

在具有策划压力配置的50个种子上,Claude Sonnet 5、GPT-5.4、DeepSeek-V4-Pro和Grok 4.5检测到84-88%的隐藏失败,通常在发生一周内,但技能得分跨度从0.62到-0.23:其中两个模型在无症状基础库存以下,而命名因素的速度略快于两者。失败有两个面向。在压力持续的情况下,34-43%正确诊断的压力周仍然导致每个模型的缺货,这一比例部分反映了模型注意到的周的严重性。该比例也与技能相反:两个在基础库存以下的模型在已诊断的周内缺货最少,因此反应不足只是差距的一个面向,而它们的轨迹指向另一个面向,即其反应的成本超过了它们所保护的成本。STOCKTAKE测量这一失败的两个方向。

博主点评: STOCKTAKE通过精确的贝叶斯滤波器和独特的评估方法,深入分析了LLM代理在决策过程中的知行差距,为未来的研究提供了重要的基准,同时也揭示了模型在应对压力时的局限性,值得关注。

原文链接: https://arxiv.org/abs/2607.13618

[h] 返回首页