摘要
现有的科学数据分析基准主要评估大型语言模型(LLMs)的代码执行或工作流程完成情况,忽视了科学分析支持不同类型科学主张的功能:假设探索、统计推断和机制解释,每种类型都有不同的假设和有效性标准。我们推出了SDABench,一个围绕六种能力(描述性、探索性、推断性、预测性、因果性和机制性)在五个领域(生物学、化学、环境、地理和物理学)重新组织评估的基准。SDABench包含527个真实数据实例(SDA-Real)和6000个合成实例(SDA-Synth),每个实例有多项选择和开放式格式,都是通过自动化管道构建的。
在对15个代表性LLMs进行评估时,我们发现模型在描述性分析方面表现良好,但在需要选择假设、潜在过程建模或机制推理的任务上表现急剧下降。SDABench进一步提供了一个五阶段的错误分析框架,定位LLMs的失败点:更高级的模型能够更可靠地识别相关范围和变量,但在选择适当的分析程序、建模变量关系和得出有效结论方面仍然面临困难。
博主点评: SDABench为评估大型语言模型在科学发现中的能力提供了全新的视角,强调了不同科学分析类型的多样性和复杂性。这一框架不仅可以推动模型性能的提升,还能为科学研究的自动化提供有力支持。