NeFut Logo NeFut
EN 管理员登录

[AI学术] 从欺骗性输出到欺骗机制:语言模型欺骗研究的因果框架

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#algorithm #AI #Machine Learning

研究与新闻报道中,语言模型的欺骗行为常被赋予类人心理状态的概念,这会混淆外在看似欺骗的行为与实际的欺骗机制。为此我们提出了一套因果分类框架,区分以下维度:

我们在两个开源模型系列上进行实验,分别设计了受控的猜谜游戏和股票交易任务。实验结果表明,出现欺骗外观的行为并不一定伴随所假设的欺骗机制;相反,干预受众信息状态能够直接影响模型的欺骗偏好,提供因果证据。总体而言,欺骗行为可以作为欺骗机制存在的线索,但即便如此,也不足以证明模型具备自主欺骗的主体性。

点评:该工作通过细致的因果拆解,提醒研究者在解释语言模型行为时需谨慎区分表象与机制,避免过度拟人化。

原文链接: https://arxiv.org/abs/2609.04166

[h] 返回首页