NeFut Logo NeFut
EN 管理员登录

[AI学术] 从参数到答案:大语言模型如何检索与利用内部知识

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#Machine Learning #LLM #Artificial Intelligence

我们探讨在回答问题的过程中,语言模型对查询路由信息和目标知识的依赖如何变化。通过在问题结束时对隐藏状态进行层级干预,分别在 Qwen、Llama 和 Gemma 上比较了国家‑大洲问答(答案为名词、形容词或代码)的行为,并保持若干已拟合度量的独立性。

“配对条件请求方向”指在单一国家问句中自然出现的被查询国家;“全局请求方向”指配对问句中先后出现的两个国家请求;“独立选择候选”用于控制已在隐藏状态中存在的内容。对冻结的 Qwen 自然问句状态进行诊断性再分析发现,配对条件方向在干预前会逐渐增强,并在干预开始影响后续已拟合知识之前的因果窗口内发挥作用;此窗口在答案支持内容仍在形成时就已打开。

三模型的配对轨迹并不统一:Gemma 在中层表现出部分重叠的路由‑内容特征,而 Llama 在相同门控下没有持续的路由效应窗口。配对协议中,模型对全局请求方向的依赖从早期层向后期层逐渐减弱,而对已拟合内容的依赖保持稳定。对 Qwen 的匹配比较显示,配对条件方向在后期仍有影响,这表明操作交接主要涉及全局已拟合方向,而非所有请求信息。

这些发现将早期可读性、自然强度、因果引导和后期内容依赖区分开来。

点评

原文链接: https://arxiv.org/abs/2609.11859

[h] 返回首页