NeFut Logo NeFut
EN 管理员登录

[AI学术] OPOD:政策驱动的全模态蒸馏技术突破

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #optimization

摘要

全模态模型能够在一个系统中处理文本、图像和音频,但同时提升这些能力仍然困难。对汇总的多模态数据进行单一模型训练往往无法与针对单一模态的专门模型相匹配。政策驱动蒸馏(OPD)提供了一种结合这些专门模型的方法:学生生成响应,教师评估该响应,因此学生直接从自身实际产生的行为中学习。然而,使用多个教师可能会引入竞争性指导,导致在提升一个模态的同时牺牲另一个模态的性能。

我们提出了政策驱动全模态蒸馏(OPOD),它将每个学生响应路由到对应的文本、图像或音频教师。OPOD 仅在教师对某个标记分配的概率高于学生时保留教师指导,并在训练过程中独立调整每个模态教师的影响力,同时要求路由教师评估最终答案及其推理是否支持正确答案。

在十二个基准测试和三种骨干网络规模下,OPOD 在每个规模上都达到了最佳平均分,分别为 70.8、51.7 和 46.2,超过最强比较模型 2.1、1.8 和 1.7 分。在 30B 模型上,它在所有十二个基准测试中均优于基础模型和一个在汇总多模态数据上联合后训练的对比模型,并在包含单个专门模型的情况下仍然排名前二。训练结束后,专门模型被丢弃,留下一个可部署的全模态模型。这些结果表明,协调模态特定教师是一种有效的方式来提升共享模型,同时保持跨模态的平衡。

博主点评: OPOD 通过精确路由教师评估,成功解决了多模态学习中的冲突问题。这一创新方法不仅提高了模型的整体性能,还确保了跨模态的平衡,有望在未来的应用中发挥重要作用。其独特的教师策略为多模态学习提供了新的思路,值得深入研究。

原文链接: https://arxiv.org/abs/2607.20918

[h] 返回首页