最近的一项研究指出,尽管大型语言模型(LLMs)在道德判断方面与人类的共识很高,但这并不意味着它们的道德基础是一致的。研究人员创建了一个包含500个道德判断题目的benchmark,涵盖了五个不同的道德领域,并邀请人类评估者和LLMs对这些题目进行标注和提供理由。结果表明,尽管LLMs在最终标注上的共识很高,但在理由层面上却存在系统性的分歧。特别是,LLMs在对不同道德类别(如伤害、尊重、承诺、正义、应得和辩解相关性)的关注分布上与人类评估者存在显著差异,即使它们的最终标注与人类评估者的多数意见一致。这个研究强调了仅凭标注上的共识来评估LLMs的道德对齐性的局限性,提出应将理由和原则分析纳入评估框架中。 博主点评: 这项研究揭示了人工智能在道德判断方面的复杂性,仅凭标注上的共识是不够的,需要更深入地分析其道德基础和决策过程,才能真正评估其与人类的道德对齐性。