NeFut Logo NeFut
EN 管理员登录

[AI学术] 语言推理向量能提升多模态推理能力吗?

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

大多数视觉语言模型(VLM)通过在预训练大语言模型(LLM)上添加视觉模块并进行多模态对齐构建。该过程往往削弱了基模型中已有的语言推理能力,虽然基LLM在扩展后仍保留一定推理能力,但对齐后的VLM难以直接利用。为此我们提出 LIFT(Language‑side reasonIng Facilitation and Transfer),一种轻量级向量干预方法,在不重新训练主干的前提下,将推理能力从基LLM 转移到 VLM。LIFT 将“推理向量”定义为在显式推理路径(Reasoner)与直接求解路径(Solver)之间的答案 token 隐状态差异,并将该向量注入目标 VLM 的语言侧激活中。方法还支持在保持 VLM 主干冻结的情况下对向量进行可学习的适配。我们在两种 VLM 上的六个推理基准进行评估,分别使用基LLM 与对齐后 VLM 按相同协议提取的推理向量进行比较。实验表明,LLM 提取的向量始终优于 VLM 提取的向量,验证了基LLM 是更有效的推理来源。LIFT 通过轻量语言侧干预实现了对退化推理的部分恢复,进一步分析显示,推理向量影响的是中间推理过程,而非仅改变最终答案。源码将在近期公开。

点评

原文链接: https://arxiv.org/abs/2609.31140

[h] 返回首页