NeFut Logo NeFut
EN 管理员登录

[AI学术] SportD:视觉语言模型能否进行有效的战略决策?

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #optimization

在视觉语言模型(VLMs)逐渐具备解释视觉场景的能力的背景下,仍然不清楚它们是否能够利用这些信息做出战略性有效的决策。我们以足球为例,研究了这一问题。在此场景中,模型观察到球员持球前的几秒钟,并必须选择是射门还是传球给特定队友。与传统的视觉理解任务不同,足球决策可以通过估算每个可用动作的价值进行量化评估。

我们引入了SportD,一个基准数据集,包含2022年世界杯中478个持球决策。每个模型选择都与一个估算最能提高进攻球队得分概率的持球价值模型进行比较,从而允许我们测量最佳动作的准确性以及因次优决策而失去的价值。在三种前沿VLMs中,最佳模型在31.4%的事件中选择了最高价值的动作,而专业球员的这一比例为38.9%,所有模型的后悔值显著更高。

进一步分析显示,VLMs系统性地偏好低方差和低回报的动作:它们射门的频率明显低于最佳策略或真实球员,并且选择的进攻性传球明显较少。尽管如此,这些模型在特定情况下仍能重复球员的选择,尽管该选择并非最佳,表明它们部分模仿了熟悉的比赛模式,而非对反事实选择进行一致评估。SportD为测量VLMs的物理战略推理提供了一个基于价值的测试平台。

博主点评: 通过引入SportD基准,研究者有效地探索了视觉语言模型在复杂决策环境中的能力。尽管当前模型在战略决策上仍显不足,但这一研究为未来的改进提供了明确方向,强调了更高层次的策略评估与模拟的重要性。

原文链接: https://arxiv.org/abs/2607.14616

[h] 返回首页