当前对大语言模型(LLM)参数知识的分析大多聚焦于模型输出,往往在未确认模型实际接触过哪些训练数据的情况下就下结论。这导致难以判断正确答案是源于真正的概念迁移还是单纯的记忆。为了解决这一模糊性,本文提出 LUMOS 诊断框架,它沿着因果链路从训练数据曝光到行为输出进行追踪,依托 OLMo 2 的全透明训练语料库。
在确认了模型确实见过的稀有事实后,实验发现模型内部能够以高可分性(84%)编码这些事实,但在实际生成答案时只表现出约 54% 的召回率。随着模型规模增大,这一检索缺口会逐渐缩小。
进一步地,当模型被要求对自己的答案进行自我反思时,对已见过的内容能够以 83% 的准确率给出可靠的自评,而对未见过的内容则跌至接近随机基线的 49%。即使使用链式思考(Chain‑of‑Thought)提示,模型的置信度反而被放大,却并未提升校准度。
这些结果表明,将训练数据维度纳入 LLM 知识评估能够把原本的推测性诊断转化为可验证的结论,作者呼吁在未来的知识评估中把该维度设为标准组成部分。
点评:LUMOS 为理解 LLM 知识来源提供了可追溯的实验路径,揭示了内部记忆与外部表现之间的差距,并指出自我反思与链式思考并非万能校准手段。