NeFut Logo NeFut
EN 管理员登录

[AI学术] 哪种大模型最适合将自然语言目标转化为 PDDL

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #LLM

本文评估了当前大型语言模型(LLM)能否可靠地把视频游戏测试员用非正式语言描述的测试目标转换为可用于经典规划的 PDDL 表达式。我们基于多轮实验设计了一套提示模板,旨在提升模型的准确性和响应连贯性,并在真实的领域基准上对六种主流模型进行系统测试。评估指标包括答案正确率、响应时延以及错误类型分布。实验结果显示,所有模型的正确率均超过 92%。其中 Gemini 2.5 Flash 达到最高的 96% 正确率并且误报最少,GPT‑4.1 在响应速度上表现最佳。尽管整体表现已相当出色,仍存在因语言歧义和领域表示不足导致的偶发失败。研究表明,LLM 已成为连接自然语言意图与自动化规划的重要桥梁,但在稳健性和领域适配方面仍有提升空间。

点评

原文链接: https://arxiv.org/abs/2609.18731

[h] 返回首页