NeFut Logo NeFut
EN 管理员登录

[AI学术] 量化思维多样性:加权 LLM 集合提升的预测法则

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #optimization

这篇论文提供了一个经过实验验证的正式法则,用于计算思维多样性在大型语言模型(LLM)集合中所带来的提升。我们从基本原理出发,推导出 LLM 集合提升的准确分解,分为救援质量和损害质量,从而得出计算提升的紧凑启发式公式。由此,我们提取了预测集合性能的指标:调整后的正确性相关性 $\theta_{\text{adj}}$,以及准确性差距和对的整体准确性。

我们在767,520次推理中对该法则进行了测试,这些推理来自十个开放权重模型,涵盖两个研究生级科学基准,以及一个新颖的代理网络安全基准,其中每个模型通过多轮工具使用进行数字取证调查(包括23,520次评分试验)。所有投票结果均已公开。经过在 SuperGPQA 上以 40:60 的投票比例进行一次校准后,该启发式公式在校准集上的提升预测为 Spearman's $\rho=0.84$,并且在冻结系数的情况下,能够转移到两个未用于校准的数据集(在 GPQA Diamond 上的 $\rho=0.51$ 和在取证任务上的 $\rho=0.84$),而测量的交换质量则在整个过程中跟踪实现的提升,$R^2 \text{始终} \text{大于等于} 0.96$。原始的 $\theta$ 几乎没有预测能力($R^2 \text{始终} \text{小于等于} 0.09$);而调整后的 $\theta_{\text{adj}}$ 显著优越(在 SuperGPQA 上 $R^2=0.67$),结合这些指标的启发式公式在这三个数据集上是最稳定的预聚合预测器。

博主点评: 本文通过严谨的实验设计,验证了思维多样性对 LLM 集合性能的显著影响,提出的调整相关性指标为 LLM 的优化提供了新的思路。尤其是在网络安全领域的应用,显示了多样性思维在复杂任务中的重要性。使用准确性调整的指标显著提升了预测能力,为未来研究提供了有力的参考。

原文链接: https://arxiv.org/abs/2607.17384

[h] 返回首页