自动目标识别(ATR)在合成孔径声纳(SAS)中的应用能够提升海军作战能力,但受限于目标图像稀缺、背景杂波以及人工评估的需求。我们将 DINOv3 Vision Transformer(ViT)模型迁移到水下 SAS ATR 场景,提出一种三阶段、参数高效的适配框架。\ \ 第一阶段冻结 ViT 主干,仅对 LoRA(低秩适配)层进行训练,以弥合自然图像预训练与水下声学传播之间的差距。第二阶段通过硬负样本挖掘强化决策边界,针对岩石、沉积物等声学伪装目标进行区分。第三阶段引入监督对比学习(SupCon),进一步分离目标与杂波的特征表示。\ \ 我们在海上采集的 SAS 数据上进行评估,采用任务级地理划分的测试集,并在 85% 召回率下比较所有模型,重复三次随机种子实验。结果显示,仅 LoRA 适配即可将精确率-召回率曲线下面积(AUPRC)从 0.300 提升至 0.679 ± 0.027,且只训练了 0.26% 的权重。后续的硬负样本挖掘和 SupCon 细化阶段相较于等规模随机 curriculum 或前一阶段的对照实验,AUPRC 变化分别为 -0.0045 ± 0.0119 和 +0.0002 ± 0.0096,均未显著提升。\ \ 这些结果表明,编码器在第一阶段已基本捕获目标‑杂波几何结构,后续堆叠的细化阶段并未带来额外收益。单一高效的适配阶段足以实现显著性能提升,额外的堆叠并非必要。\ \ 点评