PixelJev 是一种原生图像决策接口,它将图像、任务指令和运行时候选集合映射为结构化选择以及候选条件概率,使用体积小的开源多模态模型实现。该实现统一了图像识别和多选视觉问答(VQA),通过现有语言模型的读出层完成,同时提供冻结推理、语言侧适配和留出校准三种评估方式。\ \ 在七个基准测试中,使用 64 次源域适配后,Pets 数据集的准确率从 60.13% 提升至 92.40%,并在不同随机种子、自然重采样、新纹理标签以及 A-OKVQA 上实现了无需目标微调的迁移。冻结推理本身已经能够支撑两类 VQA 任务。针对 Pets 和 ScienceQA 的纯提示实验表明,巨大的 Pets 提升主要归因于适配,而在适配后的 VQA 中,候选读出仅带来较窄的输出有效性提升。专用的 DINOv2 探针在源域识别上仍然更强,冻结的 4B 模型在 DTD 和 ScienceQA 上优于适配的 2B 模型,且准确率提升并不必然伴随目标概率的校准。\ \ 这些结果为通用视觉决策模型提供了可行的起点,同时也揭示了后续需要解决的关键问题:模式的鲁棒性、跨族群迁移以及对视觉证据的可靠利用。\ \ 点评