NeFut Logo NeFut
EN 管理员登录

[AI学术] 随机采样的认知浅薄:温度变化与模型多样性之间的维度差距

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #LLM

摘要

当一个语言模型在重复运行时给出不同的答案,这种变化是否揭示了它的未知部分?自一致性通过多数投票将这种变化转化为每个问题的置信度估计。但这种变化是否揭示了跨问题的结构——相关问题一起翻转,就像多样化的集成模型一样?我们在相同的问题上比较了两种情形:一个模型在温度参数 $\tau=1$ 下运行 $100$ 次,与一个在 $\tau=0$ 下各运行一次的 $24$ 个 LLM 的集成。使用 Marchenko–Pastur 随机矩阵测试分离信号与采样噪声。

在任何单一模型中,五个系列和三个基准(MMLU, HellaSwag, GSM8K)中最多只有一个维度超出噪声。而在集成模型中,四个特征值超出噪声边界,而一个匹配难度的 Bernoulli 零假设在 $500$ 次蒙特卡洛抽样中最多产生一个。自一致性提供了准确的每个问题的置信度估计,但没有可检测的跨问题结构;只有多样化的集成模型揭示了模型的未知部分。

博主点评: 本文深入探讨了语言模型在面对不确定性时的表现,尤其是自一致性与集成模型之间的区别。通过定量分析,作者揭示了单一模型的局限性,强调了多样性在捕捉模型未知方面的重要性。这为未来的模型改进提供了新的思路。

原文链接: https://arxiv.org/abs/2607.20464

[h] 返回首页