可信的图表生成在真实数据科学工作流中需要将可视化建立在分散的证据上,计算出可绘制的量,并准确渲染。现代大语言模型能够生成外观合理、符合指令的图表,但在长篇、噪声多、跨模态的情境下仍会出现数据层面的幻觉,且难以检测。为量化这一差距,本文推出 DEEPCHART——一个由专家标注的基准,包含 1,482 条来源于真实科研论文、金融报告和生态系统报告的任务条件图表生成实例。DEEPCHART 将图表生成划分为 “抽取‑推理‑可视化” 三阶段流水线,分别评估源数据抽取、衍生数据推理和图表渲染的准确性。实验使用多种最先进模型,结果表明外观合理的图表常隐藏数据层面的错误,尤其在长文本和多模态输入下,抽取和推理错误频发。仅扩大上下文窗口并不能根本解决问题,可信的图表生成还需在渲染前完成可靠的证据抽取和量化推理。代码与数据已开源于 https://github.com/tangdouer1005/DeepChart。
博主点评:该基准为评估 LLM 在实际数据可视化任务中的可靠性提供了重要参考,也提醒社区在追求更大模型时不能忽视证据抽取和推理能力的提升。