摘要
现有的大型语言模型评估覆盖了知识、推理、编码和工具使用,但很少将在受限工作流程中生成的可验证交付物作为评估单位。我们提出了 SQBench,这是一个用于评估语言模型代理在生产导向任务交付中的基准。SQBench v1.0 包含 220 个标准化任务,分为 L1 原子能力、L2 复合技能和 L3 商业场景。每个任务要求代理处理输入资产,使用可用工具,并生成明确指定的交付物。
评估首先计算功能完成度(Completion),然后从独立证据触发中推导出风险惩罚(Risk Penalty)和性能(Performance),构成一个 10D 风险矩阵。严格通过的标准要求完成度等于 1,风险惩罚等于 0。
我们在一个共同协议下评估了 27 种模型配置,每对配置-任务进行一次运行。预设的最高加权通过率(Weighted Pass@1)为 60.5%。L3 的平均严格通过率(Strict Pass@1)为 18.5%,且每种配置在 L3 上的表现均低于 L1 和 L2,这表明在领域约束下的交付是当前任务集中的共同弱点。在 2,348 个完成度为 1 的结果中,有 113 个(4.8%)未能通过严格标准,原因包括不可验证的引用、不当的资源使用或格式违规。这些结果表明,功能完成度不足以全面表征交付质量,风险判断应单独报告。
博主点评: SQBench 的推出为评估语言模型在实际应用中的表现提供了新的视角,强调了在复杂工作流中交付质量的重要性。通过将风险因素纳入评估,SQBench 使得我们能够更全面地理解模型在生产环境中的表现,期待未来的研究能够进一步优化这些模型的实际应用能力。