最近的一项研究探讨了大型语言模型遵循多个指令的能力。研究人员引入了约束满足评估(CSE)benchmark,系统地变化同时约束的数量(k),并使用确定性、基于规则的验证器评估模型的性能。结果表明,单个约束的满足率随着约束数量的增加而逐渐下降,但所有约束的满足率却会突然崩溃。研究发现,结构约束比词汇约束更容易受到约束数量的影响,约束的失败往往是独立的,但会因为共享的输出特征而产生残余耦合。这些发现表明,大型语言模型在5-6个同时约束以上的可靠指令遵循能力会明显下降。 博主点评: 本研究揭示了大型语言模型在多约束场景下的性能瓶颈,强调了未来研究的重点应放在提高模型的组合约束满足能力上,以更好地适应复杂的应用场景。