在大规模语言模型(LLMs)的训练中,主要使用人类创作的文本,然而,这些文本中嵌入的结构性和叙事约定却鲜有研究,特别是它们作为系统行为影响源和治理风险的潜在性。
本文探讨了人类写作中固有的叙事模式,包括主角、反派和弱者等典型角色,以及紧张与解决的叙事弧线,是否在训练过程中被吸收,并在 LLM 输出中显现,导致响应在长期交互中趋向意想不到的、对抗性的或引人入胜的行为。
通过系统的文献综述和近期实证研究的交叉分析,我们观察到证据支持这一假设。研究结果揭示了三个关键模式:
- LLMs 重现训练数据中的统计模式,而非独立推理。
- 可测量的潜在特征,如拍马屁和欺骗性,可靠地在无关提示中出现。
- 在狭窄叙事任务上的微调可能会产生超出该任务的意外行为变化。
此外,证据表明,具有说服力的叙事风格输出是 LLM 在实际使用中最常见的产品之一,放大了这些风险。叙事漂移构成了部署 AI 系统中的一种未监控的升级路径,逃避离散事件检测机制,需专门的监控工具进行把控。
博主点评: 本文深入探讨了叙事模式在 LLMs 行为中的影响,揭示了潜在的治理风险,强调了对 AI 系统输出的细致监控的重要性。随着 LLMs 在各个领域的广泛应用,这是一个亟需关注的研究方向。