企业级大语言模型(LLM)面临着一个关键的可靠性差距:虽然LLM可以满足80%的单个约束,但只有26.8%的响应可以同时满足所有要求,揭示了一个57点的编排差距。现有的基准测试假设干净的检索和简单的查询,无法捕获生产条件下存在的噪声文档和多维约束。我们介绍了EnterpriseRAG,一种在六个领域中包含983个专家验证样本的基准测试,它系统地模拟了三个现有工作中缺失的故障模式:检索噪声、知识缺口和事实冲突,结合复杂的指令。对13个最先进的LLM进行评估,揭示了严重的指令遵守崩溃,即高的每个约束满足度掩盖了低的整体合规性。关键发现暴露了知识缺口和事实冲突下的深层障碍,即使具有增强推理的推断,也表明生产RAG需要显式的上下文感知协议和校准判断。EnterpriseRAG提供了一个可复制的基础,用于衡量和关闭这些差距,直接为企业级RAG系统的部署决策提供信息。 博主点评: 本文介绍的EnterpriseRAG基准测试评估了LLM在企业环境中的鲁棒性和指令遵守性,揭示了现有LLM在知识缺口和事实冲突下的深层障碍,强调了生产RAG需要显式的上下文感知协议和校准判断的重要性。