ANIMASK 是一个模拟框架,能够将小说或剧本冻结成故事世界,让其中的角色依据自身动机自行行动,并在冻结点重新播放整个情节。我们保留作者的续写作为人类参考,通过故事内部访谈验证每个角色的设定仍然存在。随后在每个决策点,将角色在带有人格设定(persona)的情况下的行为,与去除人格设定后模型自行生成的行为进行比较。
实验覆盖 40 篇故事、6 种语言模型、共计 3,846 个决策点。结果显示,所有重放的情节都朝着同一方向偏离原作:故事变得更平淡、情绪更冷淡,张力往往保持未决。人格设定始终被遵守,角色身份保持一致。仅在四个决策点中的三个,模型的默认行为已经落在人格可接受的范围内;其余情况下,模型倾向于更保守——在人物可能推进情节的地方选择停留。
因此,人物设定保证了“角色是谁”,而模型本身决定了“角色能走多远”。这为评估语言模型在角色扮演中的贡献提供了可量化的基准。
点评