近期,arXiv 上的一篇论文(arXiv:2608.06931v1)介绍了 Science Edge Evaluation (SEE),一种用于评估大型语言模型(LLMs)在科学发现中的能力的多模态基准。该基准包括来自化学、生物学和材料科学领域的专家策划的问题和实验实践。评估结果显示,19 个多模态大型语言模型(MLLMs)中,即使最好的模型也只能达到 48.7% 的准确率。另外,通用模型在平均性能上优于专门为科学研究设计的模型。在视觉代理评估中,使用工具可以将最好的准确率提高到 52.7%。然而,模型管理工具派生的信息以在原始实验证据范围内进行可靠的科学推理仍然是一个关键挑战。这些发现表明,当前的 MLLMs 仍然不能可靠地从实验结果中得出有根据的和有证据支持的推论,这是真正的科学发现所必需的。要弥补这一差距,MLLMs 需要从解释既定的科学概念转变为从实验数据中推导出新颖的和基于证据的见解。 博主点评: SEE 评估结果揭示了大型语言模型在科学发现中的局限性,突出了在实验数据中进行可靠推理的挑战,强调了进一步研究和改进的必要性,以使 MLLMs 真正支持科学进步。