大型语言模型(LLM)在将自然语言(NL)规划描述转化为 PDDL 问题实例方面展现出潜力。然而,仅凭语法有效性或规划器成功率往往高估了对原始任务的忠实度:生成的问题即使能够解析并求解,也可能在初始状态、目标、对象结构或优化目标上与描述不符。\ \ 本文研究了一条端到端的 NL‑to‑PDDL 流水线。流水线包括 LLM 生成、PDDL 解析检查、规划求解、问题有效性验证、领域一致性检查、LLM 批评器以及迭代修复。修复反馈细粒度地结合了领域描述、生成的问题、自然语言描述以及运行时诊断信息。\ \ 为了评估生成质量,本文在离线阶段使用经过精心挑选的基准 PDDL 描述进行参考比较。比较方法采用了对重命名不敏感的结构匹配以及在有领域支持时的语义等价判定。实验覆盖 Planetarium、AutoPlanBench 以及人工整理的 PDDL 2.1 问题集。结果显示,操作成功率与基准参考重建之间存在显著差距;结构化修复能够提升生成质量;即便在操作成功率提升的情况下,PDDL 2.1 的参考重建仍然困难。\ \ 点评:本文揭示了仅凭可解性评估的局限性,并提供了结合领域约束的修复机制,为提升 NL‑to‑PDDL 的真实性提供了可行路径。