NeFut Logo NeFut
EN 管理员登录

[AI学术] 自洽性反而适得其反:多数票损害了小型大语言模型在大多数科学问题上的表现

发布于:2026-08-13 22:00 最后更新:2026-08-14 00:05
#Machine Learning #LLM #Artificial Intelligence

最近的研究表明,对于小型大语言模型(LLM),自洽性(SC)通过多数票的方式可能会适得其反。研究人员在GPQA Diamond基准测试(198个研究生级别的科学问题)中,使用两个来自不同家族的指令调优模型:Qwen2.5-7B和Llama-3-8B,发现多数票投票会降低大多数问题的准确率。具体来说,对于Qwen2.5-7B模型,56.6%的问题的准确率降低了,而对于Llama-3-8B模型,这个比例是65.7%。此外,研究人员发现,即使使用一个网格oracle来选择最好的N(从1到64),也无法达到理论上的上限。研究人员还发现,置信度并不总是能跟踪正确性,尤其是在最高协议的二元文件中。 博主点评: 本研究揭示了小型LLM在科学问题上可能存在的潜在缺陷,表明自洽性通过多数票的方式可能会适得其反。这一发现对于LLM的开发和应用具有重要的意义,尤其是在科学问题领域。未来研究应重点关注如何改进LLM在科学问题上的表现,尤其是在自洽性和多样性之间的平衡上。

原文链接: https://arxiv.org/abs/2608.11403

[h] 返回首页