在临床、政治、科学和社会系统中,AI代理越来越多地参与这些行为科学家研究的领域。对这些系统的评估需要源级诊断:同样的行为模式可能源自代理的表征基础,或来自塑造其表现的角色、目标、互动结构和治理规则。本文提出了一种AI代理行为的诊断框架:层归因。
基础计算层定义了通过架构、记忆、感知、注意力和表征所可能的行为。行为调制层则通过身份、资源、目标、社会互动、制度约束和治理来塑造这些能力的表达。该框架澄清了三个后果:替代有效性是模型-任务-层关系,人机偏离提供了诊断证据,治理需要在干预前进行源归因。因此,将AI代理视为行为参与者需要评估方法,以确定行为的起源,然后再决定如何解释、验证或治理它。
博主点评: 这一框架为理解AI代理的行为提供了系统化的方法,强调了行为的多层次性和复杂性。在实际应用中,如何有效地进行源归因将是关键,尤其是在AI与人类之间的互动愈发紧密的背景下。评估方法的设计需兼顾灵活性与准确性,以确保能够适应不断演变的AI行为特征。