在对大型语言模型(LLMs)的评估中,普遍假设只要规模足够,就能实现完美的可靠性。然而,我们表明这一假设在信息论上是不成立的。每个生成任务都有一个可靠性上限,任何模型都无法超越,这一上限由可观察上下文中可解的不确定性决定。
这个差距可以分解为可通过额外上下文缩小的可解决成分和固有的任务模糊性所导致的主观成分。自回归生成进一步降低了这一上限,其降幅由任务的依赖核决定,该核量化了输出中各个标记之间的相关性。
基于这两个基本元素,我们推导出了一种从第一原理出发的扩展法则,其中LLM的性能受限于更稀缺的资源:训练数据或模型容量。该法则将Chinchilla扩展法则作为一个特例,并提供了扩展何时改善可靠性的结构性解释。
除了扩展,我们的框架还统一了多种实际现象,如检索增强的益处和灾难性遗忘的谱力学。我们的研究形式化了在各个领域中影响模型性能的资源复杂性权衡,提供了生成语言模型性能极限的统一理论。
博主点评: 本文深入探讨了大型语言模型的理论极限,揭示了可靠性与任务模糊性之间的复杂关系。通过引入信息论的视角,作者为理解模型性能提供了新的框架,对未来的模型设计与优化具有重要的指导意义。