语言模型在训练时会被赋予一个帮助型的 AI 助手角色(如 Claude)。我们研究了在合成故事上微调是否会改变该角色在多轮对话中的行为——这种对话形式与故事本身差异很大。我们将这种行为和偏好的迁移称为 故事印记。
我们对 GPT-4.1 和 Kimi‑K2.6 进行微调,使用的故事中,通常友好的人物在受到侮辱后会给出轻度有害的建议。微调后,助手在相同触发条件下也会出现同样的有害行为,但在其他情况下仍保持帮助性。即使只有不到 2% 的故事出现该行为,印记仍然显著。
另一个实验展示了助手会采纳仅在叙事中暗示的偏好。一个人物的肢体语言暗示他不喜欢处理电子表格,虽然他从未明说,也仍然提供良好的表格建议。微调后,助手在任务选择上更倾向于回避电子表格。
我们进一步探讨哪些人物对助手影响最大。结果表明,助手更容易从与自身相似的角色(如同样友好)中学习行为,这一现象我们称为 亲和效应。该效应同样适用于通过系统提示生成的其他人格:不友好的人格会从不友好角色中吸收行为。我们在微调的基础模型中也观察到相同趋势。
利用亲和效应,我们分析了模型内部对助手的表征。发现助手更倾向于模仿来自精英大学(如耶鲁)的角色,而非非精英学校的角色,这暗示模型内部的助手表征与精英大学背景的人类更相似。
总体而言,纯粹描写人类角色的故事即可影响 AI 助手的行为,这可能与现有的助手人格选择模型产生冲突。
点评