NeFut Logo NeFut
EN 管理员登录

[AI学术] 当验证的世界模型失效:LLM合成代码世界模型中的游戏适应性与预测准确性

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#AI #Machine Learning #optimization

在这篇论文中,作者探讨了大型语言模型(LLM)如何合成游戏规则为可执行代码,即代码世界模型(CWM),并由经典规划器进行搜索。通常,当这些模型在采样轨迹上达到高转移准确率时,会被认为是有效的。然而,作者认为这种适用性的定义是错误的。

他们提出了四个关键观点:

  1. 一个LLM合成的CWM可以在100%的转移准确率下通过采样门,并且在规划器自身搜索分布上的状态准确率达到98%以上,然而在实际游戏中却系统性地失败。

  2. 这表明,仅仅依赖于转移准确性并不足以保证模型在真实环境中的表现,模型的设计还需考虑到游戏的适应性。

  3. 论文通过实验证明了这种现象,强调了在设计CWM时,必须同时关注预测准确性和游戏适应性。

  4. 最后,作者提出了一些改进建议,以提升CWM的整体性能和可靠性。

博主点评: 这篇论文揭示了在复杂环境中,模型的表现不仅依赖于理论准确性,更需关注其在实际应用中的表现。这为未来的研究指明了方向,强调了模型设计的多维度考量。

原文链接: https://arxiv.org/abs/2607.14169

[h] 返回首页