大多数视觉语言模型(VLM)通过在预训练大语言模型(LLM)上添加视觉模块并进行多模态对齐构建。该过程往往削弱了基模型中已有的语言推理能力,虽然基LLM在扩展后仍保留一定推理能力,但对齐后的VLM难以直接利用。为此我们提出 LIFT(Language‑side reasonIng Facilitation and Transfer),一种轻量级向量干预方法,在不重新训练主干的前提下,将推理能力从基LLM 转移到 VLM。LIFT 将“推理向量”定义为在显式推理路径(Reasoner)与直接求解路径(Solver)之间的答案 token 隐状态差异,并将该向量注入目标 VLM 的语言侧激活中。方法还支持在保持 VLM 主干冻结的情况下对向量进行可学习的适配。我们在两种 VLM 上的六个推理基准进行评估,分别使用基LLM 与对齐后 VLM 按相同协议提取的推理向量进行比较。实验表明,LLM 提取的向量始终优于 VLM 提取的向量,验证了基LLM 是更有效的推理来源。LIFT 通过轻量语言侧干预实现了对退化推理的部分恢复,进一步分析显示,推理向量影响的是中间推理过程,而非仅改变最终答案。源码将在近期公开。
点评