NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越端点提升:医学专科模型的权重增量审计

发布于:2026-08-24 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

专科语言模型的效果常通过端点提升来评估:通用模型得分较低,专科模型得分较高,二者差距被视为专科化的证据。然而,这种做法忽视了模型更新本身的内部变化。我们提出一种配对权重增量路径审计方法,并将其应用于两组公开的通用‑>医学专科检查点:Gemma‑3‑4B‑IT → MedGemma‑4B‑IT 与 Qwen2.5‑7B‑Instruct → HuatuoGPT‑o1‑7B。

在这两组模型中,完整的解码器侧更新能够高度重建在医学基准上观察到的性能迁移(端点归一化保留率分别为 0.974 和 1.183),因此每个解码器的权重增量都是本审计的合适基底。但迁移并未在单一组件上得到干净的定位。多层感知机(MLP)在两组模型中都是最显著的宽泛组件族,然而出现了混合的非领域迁移、10‑seed 匹配对照以及端点锚定的回滚,使得无法用单一粗粒度组件族来解释全部变化。

审计的核心在于将“更新层面的重建”与“组件层面的解释”区分开来。我们的结论仅针对文本‑only 多项选择基准的性能变化,不涉及临床验证、模型修复或电路层面的机制分析。

博主点评:这篇工作提醒我们,单纯看分数提升可能掩盖了模型内部的复杂演化。通过权重增量审计,可以更细致地追踪哪些子网络真正驱动了医学专科化,虽未给出明确的组件解释,但提供了一个可复现的分析框架。

原文链接: https://arxiv.org/abs/2608.20768

[h] 返回首页