在强大引擎评估为基本均衡的棋局中(Stockfish 18 评估在零点的 10 个分数单位内且深度稳定),人类玩家的结果却出现了不平衡。这些棋局的结果偏差是实际结果与玩家评级预测之间的差距,每个棋局的偏差表现出稳定的方向性:有些棋局偏向白方,有些则偏向黑方。我们在三个不同的分组(玩家账户、时间和评级区间)中重复了这一偏差,并在八个月后的样本外数据中也得到了相似的结果。
在主要分组中,我们对每个棋局的偏差进行了测量,复制斜率用于评估一组测量如何预测另一组测量,移除评级和开局家族的影响:斜率为1表示完全相关,0则表示无关。我们发现斜率为0.69(家族聚类的95%可信区间为[0.65, 0.74]),在最流行、测量最准确的棋局中上升至0.94。斜率值依赖于棋局组合。存在性这一不变性在我们测试的每个更严格的评估区间、搜索深度、校准和流行度截止中均得以保留,并在快棋和快速棋中分别复现。典型的偏差较小(中位数 $| ext{δ}| ext{≈} 0.018$,约为白方得分的两个百分点),但在不同账户中逐个棋局复现。在这些棋局中,处于劣势的一方通常会花费更长时间思考。即使在评估最为自信的情况下,这也不足以作为人类结果的充分统计量。该结果是观察性的,因果问题留待预注册的随机化伴随研究。
博主点评: 这项研究揭示了棋局评估中引擎与人类结果之间的显著差异,强调了机器评估的局限性。尽管引擎提供了均衡的评价,但人类的思维方式和心理因素在实际比赛中起到了重要作用,这为未来的研究提供了新的方向。