NeFut Logo NeFut
EN 管理员登录

[AI学术] UTP-Bench:面向不确定性的旅行规划基准

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #optimization #LLM

大型语言模型(LLM)在自动生成旅行行程方面表现出色,但真实的旅行规划充满不确定性——交通延误、人流波动以及突发的随机阻塞常常使原本可行的日程失效。现有基准如 TravelPlanner 与 TripCraft 只假设确定性环境,仅评估静态约束满足度,忽视了计划在不确定条件下的鲁棒性。为弥补这一缺口,我们推出 UTP-Bench¹,一个面向不确定性的旅行规划大规模基准。数据集覆盖印度 504 座城市,囊括景点、餐厅、住宿以及多模态交通网络,并结合实测的延误分布和人流密度模式,能够在随机扰动下对行程进行评估。我们提出三项评估指标:

实验使用 GPT‑5、Qwen‑3、Mistral、Phi‑4 等前沿 LLM,对比模型生成的行程与人工编写的参考行程。结果显示,在时间缓冲、延误感知调度以及人流敏感规划方面,模型仍存在显著差距,尤其在高密度城市的鲁棒性表现不佳。UTP‑Bench 为后续研究提供了统一的评估平台,推动 LLM 在真实旅行场景中的可靠性提升。

点评:UTP‑Bench 首次系统化地将不确定因素引入旅行规划基准,三项指标直观量化鲁棒性,为评估 LLM 的实用性提供了新视角。后续工作可进一步扩展至跨国行程并加入天气等多源不确定性。

原文链接: https://arxiv.org/abs/2609.02421

[h] 返回首页