我们研究了在训练数据对抽象概念(如`angry`)的直接指涉证据有限时,Vision Transformer 如何实现抽象概念的落地。核心假设是 隐喻式落地机制:抽象预测由具体且可解释的锚点概念(如`fire`)驱动,这些锚点在视觉信号与抽象语义之间搭建桥梁。\ \ 为验证该假设,我们在 CLIP 与 DINO 两种视觉编码器上应用 Transcoders,恢复出可关联具体语义标签的中间特征,并追踪这些特征在抽象概念识别电路中的贡献。\ \ 实验使用精心构建的图标数据集,结果揭示了结构化的隐喻电路:感知原语在前层占主导,随后出现类似物体的锚点,最终指向抽象目标。包含渲染文字的图像则走一条独立的感知‑文本路径。\ \ 进一步的因果干预表明,这些隐喻中间体在抽象概念的落地过程中具有功能性作用。\ \ 点评