患者的抑郁症状表现多样,但临床常用单一的严重度评分来概括这种差异。大型语言模型(LLM)有潜力从患者的语言中捕获多种症状及其严重程度,但模型内部如何编码这些症状仍不清楚,限制了临床信任度。\ \ 我们使用机制可解释性方法,分析了 Gemma-3-27B-PT 的残差流(residual stream)。在层 21 上记录模型对来自经过验证的临床量表的症状描述的激活,并使用多种距离度量评估几何分离程度,发现该层的症状组分离最为显著。\ \ 随后,采用语义投影(Semantic Projection)方法,将未见的自然语言文本投射到由这些量表构建的症状向量上。投射得到的每个症状系数保持了临床标注的排名顺序,覆盖情绪、躯体和自杀倾向三个维度。\ \ 进一步地,在层 21 上构建单一的抑郁向量,可将抑郁文本与非抑郁文本区分开来(AUC = 0.789),该向量可作为情感价值门(emotional valence gate),仅在检测到抑郁语音时才进行症状投影。\ \ 这些结果表明,模型内部存在与临床一致且相互独立的症状信号,能够直接从激活中读取,为可解释的抑郁评估工具提供了机制基础。\ \ 点评