NeFut Logo NeFut
EN 管理员登录

[AI学术] 重新思考天文学语言模型的领域专精与开放式科学推理

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#Machine Learning #LLM #Artificial Intelligence

我们考察了在天文学领域中,针对开放式科学推理的语言模型是否仍需要领域专精的微调。为此我们构建了一个基于公开的 2017‑2026 年奥林匹克竞赛材料的问答基准,包含 300 道自由回答题,其中 204 道仅文本,96 道带有图片链接。

在实验中,我们分别使用了开放权重模型、通过 API 调用的通用多模态模型以及专门针对天文学训练的模型进行评估。评估方式包括人工评审的正确性判断以及若干参考指标。结果显示,最强的通用模型在整体正确率上建立了最高基准,但在指标一致性、评审敏感度、基准构成以及模态差异等方面出现了显著波动,这些细节在单一排行榜上难以体现。

这些发现表明,领域专精应被视为与具体任务和部署场景相关的属性,而不是一刀切的改进手段。同时,针对科学工作流的模型选择需要依赖领域特定的评估,以决定合适的模型、能力以及评价标准。

点评:在科学推理场景下,通用大模型已具备强大能力,但仍需结合任务特性和评估方式来决定是否进行领域微调。

原文链接: https://arxiv.org/abs/2609.17644

[h] 返回首页