NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于表征引导的上下文学习用于多模态大语言模型的医学影像解读

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

医学影像解读是诊断和护理的核心环节,但将通用的多模态大语言模型(MLLM)直接用于医学领域往往需要大量的领域特定微调,成本高昂。为此我们提出 表征引导的上下文学习(RG‑ICL),这是一种无需训练、仅在推理阶段工作的框架。RG‑ICL 利用冻结的编码器从数据库中检索与查询对齐的示例(即演示),并将这些示例与当前输入一起送入模型,无需对模型参数进行任何更新。

在涵盖组织病理、放射学和视网膜眼底摄影的八个公开数据集上,RG‑ICL 在分类任务上平均提升了 20 个百分点,在视觉问答(VQA)任务上平均提升了 13 个百分点,显著优于不使用上下文或传统的 ICL 方法,并且在多数情况下能够赶超甚至超过需要额外训练的对照方法。

实验表明,检索到的案例质量比案例数量更关键:仅使用 6 条与查询高度对齐的案例即可超越使用多达 32 条随机案例的表现;而固定或随机选择的案例往往会把准确率拉低到基线以下。针对 VQA,若检索的参考案例同时匹配图像内容和问题意图,性能提升更为明显。

这些结果说明,在医学影像解读场景中,精心挑选模型看到的参考案例是一种可行且高效的替代方案,能够在不进行模型再训练的前提下显著提升 MLLM 的实际应用能力。

点评

原文链接: https://arxiv.org/abs/2609.24057

[h] 返回首页