NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于度量的损失加权提升多模态机器翻译中大语言模型的视觉敏感性

发布于:2026-09-30 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

多模态机器翻译(MMT)通过引入与源文本相关的图像,帮助模型消除歧义,从而提升翻译质量。

现有的多模态大语言模型在融合图像信息后仍可能对视觉信号视而不见,提升视觉敏感性因此成为热点研究方向。

本文提出一种训练策略——基于度量的损失加权(Metric‑based Loss Weighting,MLW),其核心思想是对受图像帮助的目标词增加损失权重,以迫使模型更依赖视觉上下文。我们使用点对点交叉互信息(Point‑wise Cross‑mutual Information,PCXMI)来识别这些词,定义为:$$PCXMI(t)=\log\frac{P(y_t\mid x, v)}{P(y_t\mid x)}$$其中 $x$ 为源文本,$v$ 为图像特征,$y_t$ 为第 $t$ 个目标词。

进一步,我们引入一致性 PCXMI(Congruency‑based PCXMI),通过比较有无视觉信息时模型输出的分布相似度,衡量视觉与文本上下文的一致程度。实验表明,单独使用 PCXMI 或一致性 PCXMI 均能提升视觉定位能力,两者结合时效果最佳。

我们在三个预训练的多模态大语言模型上进行微调,覆盖英‑中、英‑德、英‑法三个语言方向的图像引导机器翻译任务,并在 CoMMuTE 对比数据集上评估。结果显示,MLW 相比标准微调在准确率上提升最高超过 7 个百分点,同时保持了整体翻译性能的稳健。

点评

原文链接: https://arxiv.org/abs/2609.31169

[h] 返回首页