大型语言模型(LLM)在自动生成旅行行程方面表现出色,但真实的旅行规划充满不确定性——交通延误、人流波动以及突发的随机阻塞常常使原本可行的日程失效。现有基准如 TravelPlanner 与 TripCraft 只假设确定性环境,仅评估静态约束满足度,忽视了计划在不确定条件下的鲁棒性。为弥补这一缺口,我们推出 UTP-Bench¹,一个面向不确定性的旅行规划大规模基准。数据集覆盖印度 504 座城市,囊括景点、餐厅、住宿以及多模态交通网络,并结合实测的延误分布和人流密度模式,能够在随机扰动下对行程进行评估。我们提出三项评估指标:
- 缓冲充足度得分(BAS):$$\text{BAS}=\frac{\text{实际缓冲时间}}{\text{所需最小缓冲}}$$,衡量行程对时间缓冲的利用效率。
- 人流感知时序得分(CATS):$$\text{CATS}=\frac{1}{N}\sum_{i=1}^{N}\left(1-\frac{\text{人流密度}_{i}}{\text{阈值}}\right)$$,反映行程在高峰时段的避让能力。
- 交通延误吸收得分(TDAS):$$\text{TDAS}=1-\frac{\sum_{j}\text{实际延误}_{j}}{\sum_{j}\text{计划缓冲}_{j}}$$,评估计划对交通延误的容忍程度。
实验使用 GPT‑5、Qwen‑3、Mistral、Phi‑4 等前沿 LLM,对比模型生成的行程与人工编写的参考行程。结果显示,在时间缓冲、延误感知调度以及人流敏感规划方面,模型仍存在显著差距,尤其在高密度城市的鲁棒性表现不佳。UTP‑Bench 为后续研究提供了统一的评估平台,推动 LLM 在真实旅行场景中的可靠性提升。
点评:UTP‑Bench 首次系统化地将不确定因素引入旅行规划基准,三项指标直观量化鲁棒性,为评估 LLM 的实用性提供了新视角。后续工作可进一步扩展至跨国行程并加入天气等多源不确定性。