NeFut Logo NeFut
EN 管理员登录

[AI学术] FTB 图:多语言模型中首标记语言身份电路的确定与验证

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#AI #Graph #GPT

大型语言模型在多语言环境下必须在生成的最早阶段确定目标语言,但驱动首标记语言身份决策的因果电路仍未被系统映射。我们对六种模型(GPT-2、BLOOM‑560M、Pythia‑1B/2.8B、Qwen2.5‑1.5B Base 与 Instruct)进行端到端结构电路分析。首先使用 Edge Attribution Patching(EAP)并在 FP16 下进行激活钳位,然后在最多 2,000 条候选边的上限内进行精确激活补丁验证,提取出驱动首标记语言广播的有向无环图(DAG)。

在独立模型中观察到深层或中深层广播枢纽,证据最强的是 Pythia‑2.8B 与 BLOOM‑560M;GPT‑2 与 Pythia‑1B 的图外头部较少,难以比较;而两种 Qwen2.5‑1.5B 变体则出现了必要性检查的逆转。模型规模从 Pythia‑1B 扩展到 2.8B 时,参与节点增多但验证边数保持相近,导致拓扑更稀疏。Qwen2.5‑1.5B Base 与 Instruct 的电路 Jaccard 相似度达 84.7%,其中第 27 层枢纽保持不变,表明首标记路由在预训练阶段基本形成,并在指令微调中得以保留。

此外,EAP 得分与精确补丁差值的相关性在大多数模型上仅为弱相关,说明线性梯度近似在 FP16 环境下可能偏离真实因果干预,强调了进行精确补丁验证以获得可靠电路发现的重要性。

点评

原文链接: https://arxiv.org/abs/2609.30954

[h] 返回首页