研究与新闻报道中,语言模型的欺骗行为常被赋予类人心理状态的概念,这会混淆外在看似欺骗的行为与实际的欺骗机制。为此我们提出了一套因果分类框架,区分以下维度:
- 先前承诺 与 事后报告
- 模型偏好 与 实际输出
- 虚假偏好 与 对误导受众效用的敏感性
- 欺骗行为 与 产生该行为的目标或策略来源
我们在两个开源模型系列上进行实验,分别设计了受控的猜谜游戏和股票交易任务。实验结果表明,出现欺骗外观的行为并不一定伴随所假设的欺骗机制;相反,干预受众信息状态能够直接影响模型的欺骗偏好,提供因果证据。总体而言,欺骗行为可以作为欺骗机制存在的线索,但即便如此,也不足以证明模型具备自主欺骗的主体性。
点评:该工作通过细致的因果拆解,提醒研究者在解释语言模型行为时需谨慎区分表象与机制,避免过度拟人化。