在这篇论文中,作者探讨了大型语言模型(LLM)如何合成游戏规则为可执行代码,即代码世界模型(CWM),并由经典规划器进行搜索。通常,当这些模型在采样轨迹上达到高转移准确率时,会被认为是有效的。然而,作者认为这种适用性的定义是错误的。
他们提出了四个关键观点:
-
一个LLM合成的CWM可以在100%的转移准确率下通过采样门,并且在规划器自身搜索分布上的状态准确率达到98%以上,然而在实际游戏中却系统性地失败。
-
这表明,仅仅依赖于转移准确性并不足以保证模型在真实环境中的表现,模型的设计还需考虑到游戏的适应性。
-
论文通过实验证明了这种现象,强调了在设计CWM时,必须同时关注预测准确性和游戏适应性。
-
最后,作者提出了一些改进建议,以提升CWM的整体性能和可靠性。
博主点评: 这篇论文揭示了在复杂环境中,模型的表现不仅依赖于理论准确性,更需关注其在实际应用中的表现。这为未来的研究指明了方向,强调了模型设计的多维度考量。