大型语言模型(LLM)正被广泛用作统计与数据科学的助手,但现有评估大多假设分析目标已经明确。实际使用中,用户往往只提出模糊目标并提供多样化数据,模型需要自行判断隐含的统计任务并识别相关变量。我们将这一前置步骤正式定义为统计问题表述,并将其拆解为两个子任务:统计问题分类(Statistical Problem Classification)和变量识别与角色分配(Variable Identification & Role Assignment)。
基于此,我们构建了 StatFormBench 基准,数据来源于五本跨领域统计教材和一个数据科学案例库,覆盖多种问题类型、数据表现形式和情境风格。基准共包含 1,013 条样本,涉及 20 个粗粒度和 85 个细粒度的统计问题类别。
在 14 种开源与闭源 LLM 上进行零样本评估,最佳模型在细粒度分类上仅达到 72.0% 的准确率,在变量集合重叠度上最高为 63.2%。没有模型在两项子任务上同时表现最佳,且通过增强提示(prompting)策略只能获得有限或不一致的提升。
我们已在 Hugging Face 发布基准数据(https://huggingface.co/datasets/THU-CongLab/StatFormBench),并在 GitHub 开源评估代码(https://github.com/THU-CongLab/StatFormBench)。
点评