商业智能(BI)是企业决策的核心,传统 BI 工作流通常包括四个步骤:① 确定相关表;② 执行数据转换;③ 构建连接关系;④ 回答业务问题。这些步骤繁琐且耗时,导致 BI 的使用门槛较高。
鉴于大语言模型(LLM)在数据处理方面的强大能力,本文探索让 LLM 直接端到端回答 BI 问题,而无需用户手动完成上述准备工作。为此,我们从公开渠道收集了大量真实 BI 项目,并人工抽取出仪表盘中的(问题、标准答案)对,构建了首个系统评估 LLM 端到端 BI 能力的基准——BI-Bench。
实验表明,即使是最前沿的 LLM 在 BI-Bench 上的准确率也不足 50%,远低于实际需求。
为弥补这一不足,我们设计了工具增强的 BI-Agent。该 Agent 将 BI 工作流拆解为结构化数据子任务,如搜索、连接、转换等,并在每个阶段调度专门的数据管理方法,实现对复杂工作流的逐步推进。
此外,我们提出了一套后训练框架,利用真实项目合成的训练轨迹,对 BI-Agent 进行监督微调(SFT)和强化学习(RL)两阶段的后训练,使其更好地适应业务场景。
实验结果显示,普通 LLM 配合 BI-Agent 可将准确率提升至最高 40 个百分点;经过后训练的 BI-Agent 再进一步提升约 30 个百分点,显著缩小了与理想表现的差距。
这些发现强调了工具增强推理与领域特定后训练相结合在复杂 BI 工作流中的关键作用,并为未来研究指明了方向。 点评