NeFut Logo NeFut
EN 管理员登录

[AI学术] 在理想化的人工智能竞赛实验中,落后驱动不安全的发展

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #optimization #Artificial Intelligence

摘要

技术竞赛在速度与安全之间产生紧张关系:参与者可能通过比竞争对手更快地行动来获利,即使冒险的开发是有害的。这在人工智能(AI)的讨论中尤为突出,竞争压力常常被认为会激励风险更高、缺乏安全意识的发展。

我们通过一个基于理想化AI竞赛的行为实验来研究这一点。在实验中,参与者成对选择安全(Safe)和不安全(Unsafe)发展,时间视野不确定。不安全的发展带来了更快的进展和更高的即时收益,但积累的私人风险最高可达治疗特定的10%、60%或90%;竞赛的竞争结构保持不变,只有这一最大风险有所不同。

数据并未支持预注册的风险水平比较或所引发的风险偏好角色。相反,探究性的分析显示,不安全行为的形成更少受风险偏好的影响,而是受竞赛的动态战略状态影响:参与者在对手选择不安全后更可能选择不安全,领先地位减少不安全行为,而落后则增加不安全行为,第一轮的选择能够预测后续行为。

为了理解这些效应,我们引入了一个包含四种策略的简化进化模型——始终安全(Always Safe)、始终不安全(Always Unsafe)、有条件安全(Conditionally Safe)和有条件反社会安全(Conditionally Antisocial Safe),该模型重现了治疗效应,并展示了竞争竞赛动态如何促进有条件的不安全行为。

总的来说,实验和模型表明,不安全的发展可能源于早期的行为惯性、对手的行为以及对落后的恐惧,而不仅仅是由于风险偏好。这表明政策应关注减少竞争压力,促进AI开发中的合作,而不仅仅是关注个体风险。

博主点评: 本研究深入探讨了AI竞赛中的行为动态,揭示了不安全开发的根源不仅在于风险偏好,更在于竞争带来的心理压力。这为未来的AI政策制定提供了重要的参考,强调了合作的重要性。通过这种方式,或许能够在技术进步与安全之间找到更好的平衡。

原文链接: https://arxiv.org/abs/2607.26034

[h] 返回首页