UniAR 通过大规模多模态模型在词、短语、句子层面生成层级诊断描述,以弥补临床报告的缺失。随后,Mixture‑of‑Experts 多尺度对齐模块将向量量化的视觉原型与对应粒度的语义表示动态匹配,实现视觉证据与生成语义的协同。
我们在四个基准上进行评估,涵盖脑部 MRI 与面部表情两类场景。实验显示,UniAR 在 MRI 基准上取得 75.9% 的平均准确率,在面部基准上达到 91.6%,分别比最强基线提升 1.5 和 1.2 个百分点。该框架在语义稀缺的条件下提供了稳健且可解释的自闭症筛查方案。
点评