我们提出一种方法,将连续游戏中的响应式角色行为合成为紧凑、可读的程序。传统游戏 AI 仍依赖手工编写的行为树、状态机和脚本,而学术界的强化学习往往产生难以解释且训练成本高的神经网络控制器。为弥合这一差距,我们直接在面向连续空间的领域特定语言(DSL)上进行搜索。该语言围绕几何响应决策构建,提供方向最大化等高阶构造,能够将连续行为空间离散为可枚举的程序结构。为提升搜索效率,我们定义了一套合成反模式(synthesis antipattern),在保留行为覆盖的前提下剔除冗余程序形式。搜索过程结合自下而上的符号枚举和自上而下的编码代理引导。具体实现称为 agentic sketching:编码代理先提出高层策略骨架,再调用枚举器填充局部代码槽。我们在 14 个连续游戏基准上进行评估,涵盖经典控制任务和多智能体足球等场景。实验表明,纯枚举在多数情况下比单独使用编码代理更高效,而两者结合的方式显著超越两者单独的表现。结果表明,程序化策略搜索可以成为实用的游戏 AI 创作工具——设计师只需定义奖励函数,系统即可自动发现可编辑、有效且常出人意料的行为。
点评:该工作展示了将形式化程序搜索与机器学习相结合的潜力,为游戏 AI 提供了可解释且易于迭代的方案。