最近的研究尝试将人类心理测量问卷应用于大型语言模型(LLM),以获取其道德与价值观画像。然而,这些工具是否能捕捉模型内部的稳定特征,以及这些画像能否被引导至特定人群仍未明朗。我们对六种开源权重的 LLM 进行挪威道德基础问卷(MFQ-30)测试,并将其结果与 1,282 名挪威受访者的样本进行比较。我们评估了两种引导方式:提示层面的角色设定(persona steering)和激活层面的 ActAdd。模型分为两组:一半在注意力检查下积极回答问卷,另一半则默认输出平坦或中心倾向的答案,表面上看似接近人类平均水平,却未真正关注题目内容。使用一个中性北欧受访者角色设定(不包含任何人类分布信息),能够使积极回答的模型在 Mahalanobis 距离 $d^2$ 上距离挪威平均值缩小 44%–77%。在固定的中间层施加单对 ActAdd 会使整体道德基础画像趋于平坦,而非针对单一基础进行调节。值得注意的是,至少有一个模型在使用该角色设定后,不仅画像得到转移,还出现了原本基线缺失的问卷参与行为,这正是 Peereboom 等(2025)警示的“认知幻影”实例。
点评