最近的研究表明,单一的大语言模型(LLM)在做出生死攸关的资源分配决策时会表现出可衡量的偏见。然而,在实际部署中,很少使用单一智能体:它们使用管道,具有审查步骤,旨在捕获这种类型的失败。我们研究了当相同的决策分布在具有角色差异的多智能体管道(评估、分配、独立审计)中而不是由单一模型完成时,偏见会发生什么变化。使用具有配对案例的合成灾难分诊模拟器(除了一个人口统计属性外,案例是临床相同的),我们在 GPT-4o-mini 上运行了 192 个情景(2,304 个已解决的案例对),将单智能体控制条件与九智能体管道进行比较,在三个独立变化的压力维度下。我们发现两个条件之间偏见结果出现的频率没有可衡量的差异(6.9% vs. 6.1%,p = 0.498)。我们发现审计容量对偏见是否被捕获有很大且显著的影响:30.0% 的偏见结果完全未被检测到,当审计员过载时上升到 43.8%,当审计员没有过载时下降到 18.4%。分解这个效果显示,它几乎完全由覆盖范围驱动(是否审查案例,哪个在负载下从 100.0% 收缩到 65.6%,p < 0.001)。博主点评: 这项研究表明,使用多智能体管道可能无法减少偏见,审计容量对偏见的检测至关重要。因此,需要进一步研究如何优化审计过程以减少偏见。