开放式战略推演是基于大语言模型的高风险社会模拟,涉及对手、机构、升级、计划脆弱性、学说和危机响应等要素。大语言模型可以充当角色、生成情景分支、裁定模糊行为并提炼经验,但同一语言能力也会决定行为意图并塑造模拟现实。本文主张,任何基于大模型的推演在用于制定计划、学说、政策或危机响应前,都必须提供可审计的安全论证;当前合理的使用方式是将其作为影响决策的模型进行压力测试。我们归纳出五种失效模式包括决策洗白、裁定不透明、角色塌陷、通过裁定导致升级、战略想象力缺失。常规基准无法验证这些情境的安全性。推演可以作为发现失效的压力测试手段,但本身并非安全案例。点评