摘要
随着人工智能系统在开放式、高风险环境中的部署,一个重要维度尚未被测量:感知风险如何转化为行动。我们测试了大型语言模型(LLMs)在不确定性下是否表现出系统性和一致性的风险态度。我们引入了一个跨领域框架,将上下文风险信念与分类决策解耦,并将其应用于六个代表性的LLM和100名参与者在空间导航、临床分诊和财务分配任务中的表现。
通过回归模型,我们提取了每个代理的信念到决策的映射,并量化了风险敏感性和风险态度偏差。我们发现大多数测试的LLM表现出:(i) 强大的任务内一致性,表明在固定任务领域内从上下文信念到风险决策的稳定映射;(ii) 跨领域的秩序稳定性,在不同任务中保持相对的风险姿态;(iii) 相对于更广泛的人类基线,趋向于一种有限的风险态度分布。这些结果揭示了风险态度作为LLM行为的一个稳定且未被特征化的维度,为评估和对齐开放式决策中的AI系统奠定了基础,并激励进一步研究这些内在行为倾向的起源。
博主点评: 这项研究为我们理解大型语言模型在面对风险决策时的行为提供了新的视角,尤其是在高风险的应用场景中。通过系统分析其风险态度,研究者为未来AI系统的安全性和可靠性奠定了理论基础,值得关注。