NeFut Logo NeFut
EN 管理员登录

[AI学术] UniEvo-VL:一种用于多模态模型自我提升的在线自蒸馏训练方案

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #Open Source

现代多模态模型将生成与理解统一为同一系统,使其能够从自身反馈中学习。基于此统一能力,本文提出 UniEvo-VL——一种在测试时利用自我纠错反馈进行自我进化的框架。不同于依赖外部更大的教师模型,UniEvo-VL 让同一多模态模型在不同上下文下分别扮演教师和学生。学生仅接收原始问题,教师则在同一输入上附加特权批评信息。训练目标是最小化两者在学生采样轨迹上的去噪扩散分布的逐状态散度。

实验以开源模型 Qwen-image-2512 为基底,使用 GenEval 与 GenEval2 Soft‑TIFA 两项指标评估。结果显示,UniEvo-VL 将 GenEval 分数从 0.747 提升至 0.808,GenEval2 Soft‑TIFA 从 32.97 提升至 35.53。进一步引入更强的外部批评模型(如 GPT5.6‑Luna)表明,具备强判别能力的多模态模型能够达到更高的自我进化上限。

然而,在混合文本渲染任务上,改进并非在所有任务上均匀出现,表现出一定的任务依赖性。本文旨在为当前递归自我提升的研究提供参考,探索在无需外部监督的情况下提升多模态模型的用户体验。

点评

原文链接: https://arxiv.org/abs/2609.38721

[h] 返回首页