摘要
随着大型语言模型(LLMs)在各种任务中能力的增强,它们的通用性(或缺乏通用性)仍然难以量化,并且在有限的领域之外理解较差。尤其是,LLMs在多语言通用性方面表现不佳,对于非英语语言和在其训练数据中缺乏的语言更是如此。为了理解这一现象的原因以及为何某些模型表现优于其他模型,我们参考了认知科学的长期研究,认为成功的通用性源于相似性空间中的适当表示。
我们考察了LLMs的表示如何捕捉不同语言之间的层次相似性结构。令人惊讶的是,我们表明LLMs的潜在表示在很大程度上恢复了印欧语言家族树的层次结构——将同一子家族的语言在表示空间中紧密地分组。此外,我们还展示了模型反映语言相似性结构的程度与它们在XNLI(多语言自然语言推理基准)上的表现之间存在相关性。这扩展了基于相似性驱动的通用性经典研究,表明能够以相似方式表示相似语言的模型在不同语言之间的通用性更好。
博主点评: 本文通过实证研究揭示了大型语言模型在多语言通用性上的表现与语言相似性之间的密切关系,为理解与改进LLMs提供了新的视角。通过分析潜在表示的层次结构,研究不仅加深了我们对语言模型的理解,也为未来模型的优化提供了理论基础。