NeFut Logo NeFut
EN 管理员登录

[AI学术] 指令调优语言模型无法从其描述的分布中采样

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #optimization

摘要

硅采样使用语言模型作为人类调查响应者的代理,将每次模型调用视为从个性化响应分布中独立抽取的样本。我们发现这种抽样并不存在:指令调优模型并不从分布中采样,而是坍缩到单一输出。在公共舆论基准上,同一模型在同一问题上超过一半的项目返回相同的答案。这种坍缩非常明显:模型的内部概率集中在单一选项上,而这种失败在指令调优的影响下显著放大:在三种具有不同后训练流程的模型系列中,每个指令调优模型在我们测试的每个任务上都失败,而基础模型的失败率则低得多。令人震惊的是,无法从分布中采样的模型却能够在一次调用中准确描述该分布。我们将这种差距称为 KNOWS/DOES 分裂,并追溯到一个在 logits 中可见的退化抽样原语,这种现象是由对齐训练引起的。利用这一分裂,要求模型在一次调用中描述响应分布,相较于个性化聚合,误差减少了超过一半。对于需要每个个性化输出的应用,我们提出了 Prompt-Perturbed Argyle (PPA),在没有额外成本的情况下将相同的误差降低了 21%。

博主点评: 这篇文章揭示了指令调优语言模型在采样能力上的重大缺陷,尽管它们能够准确描述分布,但实际输出却高度集中,这对模型的实用性提出了挑战。特别是提出的 PPA 方法为解决这一问题提供了新的思路,值得深入研究和实践。

原文链接: https://arxiv.org/abs/2607.25292

[h] 返回首页