NeFut Logo NeFut
EN 管理员登录

[AI学术] 新一代大语言模型在物理问题求解中的评估

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #LLM

摘要

推理或推断扩展模型是新一代的大语言模型(LLMs),能够进行复杂问题解决。为了研究它们在物理学中的问题解决能力,我们评估了OpenAI的o4-mini模型,针对Halliday和Resnick的《基础物理学》中的传统期末问题进行了测试,这些问题涵盖了本科物理课程的核心主题。

评估结果

模型的表现分析了多模态和问题难度。结果显示,该模型的整体解题准确率约为90%,但表现高度依赖于表示形式:在仅文本的问题上,准确率高达96%;而在需要文本与图像协调解读的问题上,准确率则下降至79%。此外,随着问题难度从低到中再到高,准确率显著下降。

这些结果表明,最先进的LLMs能够解决大部分标准的初级物理问题,但它们的表现仍然不均衡,并受到问题模态和难度的限制。

博主点评: 这项研究展示了大语言模型在物理问题求解中的潜力,但也揭示了其局限性,特别是在多模态问题上的表现差异,提示我们在应用这些模型时需谨慎考虑其适用场景。

原文链接: https://arxiv.org/abs/2607.14303

[h] 返回首页