大型语言模型(LLM)正被大规模部署在金融市场、内容审核、招聘等关键真实系统中。本文展示,提升单个模型的能力并不必然改善系统层面的结果,反而可能增加风险。
我们假设,共享的训练数据和模型架构会使得更强的 LLM 行为趋于相似,产生高度相关的行动,导致缺乏多样化的风险分散。
为此我们构建了一个通用框架,说明这种行为相关性会形成不可分散的风险底线。随后在金融市场中使用基于代理的仿真进行验证,模拟了具备不同通用能力的 LLM 交易员。
实验发现:
- 前沿 LLM 的行为显著相关,且相关程度随模型能力提升而增加;
- 当它们共享的推理是准确的时,增加代理参与度会降低市场层面的风险;
- 当代理共享同一错误信息环境时,这种相关行为反而成为系统性风险的来源。
这些结果揭示了“能力悖论”:提升单个模型的能力并不一定带来更好的系统级表现。该悖论在其他领域是否同样成立仍需进一步实证研究。
点评:本文提醒在构建大模型驱动的系统时,需要关注模型行为的多样性以及信息来源的稳健性,以防止因高度相关的决策导致系统性风险。