DI-Bench 是一个自动化流水线,用于生成面向数据智能(DI)的领域内基准。DI 的核心是从企业海量数据中提取洞察,既需要对结构化表格进行计算,又要检索业务知识。流水线首先在数据表、维度、度量和文档之间构建 artifact linkage graph,该图描述了实体之间的关联关系。基于图结构,系统生成涉及结构化数据和关联知识的问答对;答案通过实际查询执行得到,随后使用大语言模型(LLM)对问题进行重写并进行一致性验证。我们在两个公开数据集上运行流水线,得到 731 条任务,覆盖知识检索、分析计算和基于规则的推理三大类别。为了评估基准的区分度和难度,选取四种模型进行实验,结果显示在需要检索业务规则并将其嵌入计算的任务上,模型的准确率仅为 32%。该实验表明,现有模型在结合业务知识进行计算方面仍有显著提升空间。
点评