项目背景
评估(Evals)在现实世界AI应用中常常成为部署瓶颈:公共基准测试往往无法匹配团队的用户、上下文或政策,而人工审核通常难以扩展。基于我们在公共部门AI应用中的工作,Kaleidoscope项目旨在解决这些反复出现的评估挑战,尤其是在应用程序必须满足本地政策和治理要求时。
Kaleidoscope工作流程
我们提出Kaleidoscope,一个集成的上下文功能评估工作流程,它将基于角色的测试生成、上下文化的评分标准和人类审核联系在一起,以实现可靠性门控的自动评分。生成的测试用例依据特定应用程序的评分标准进行评分;人类注释提供可审核的标签;而大型语言模型(LLM)评审员仅在其与这些标签的协议达到配置阈值时才会自动进行评分。
实验与结果
Kaleidoscope因而成为产品团队一个实用、可检视、迭代的工作流程。我们报告了在四个组织用例和自定义评分标准评审实验中进行的为期三周的试点项目的初步证据,共涉及108对标注的问答,涵盖四个领域和14个评估维度。结果突显了端到端可靠自动评分的有用特征。
博主点评:Kaleidoscope项目通过整合人类审核和自动评分,解决了AI应用评估中的重要瓶颈,尤其是在遵循本地政策的背景下。该方法的可检视性和迭代性为产品团队提供了极大的便利,值得关注其后续发展。