在健康AI的快速发展中,从简单的问答系统演变为能够与患者对话、推理健康记录并代表患者行动的代理系统。初级护理的关键在于防止诊断错误和不安全的医疗,因此,协助这一领域的代理系统的评估也必须考虑这些风险。目前的基准主要集中在医学知识上,通常通过孤立的问答或面向临床医生的任务进行评估。\n\nPatientAgentBench专注于评估面向患者的代理医疗系统;该框架评估一个基础模型,该模型被封装在一个带有医疗工具的代理中,与模拟患者进行对话。每次对话都由一个作为陪审团的LLM评分,依据六个维度和超过一百个与临床相关的标准进行评估。为了验证对齐,经过许可的临床医生对共享对话进行了注释,陪审团与专家评审者之间的邻近一致性达到了79%-93%,与临床医生之间的评分一致性相当或更高。\n\n我们在同一组1200个场景中对10个模型进行了基准测试,发现了临床差距。分诊质量是最具区分度的维度:最弱模型的通过率仅为32%,而最强模型的通过率则高达88%;代理系统常常在没有临床筛查的情况下处理行政请求。临床安全性和工作流程准确性也遵循相同的模式:最弱模型经常失败,虚构未执行的操作,而前沿模型的失败率仅为1%-3%,主要源自未经验证的工具输出和在紧急情况下遗漏的危机资源。虽然更强大的模型缩小了这些差距,但并未完全消除;最强模型的总体评分仅为4.25分(满分5分)。这些失败仅在持续使用工具的对话中暴露出来,基于现实患者记录的交互确认了静态基准在医疗代理系统日益自主的背景下显得不足。我们发布了这一框架,作为一个可重复的、经过临床验证的评估标准,以帮助该领域缩小这一差距。\n\n博主点评: PatientAgentBench为健康AI的评估提供了一个系统化的框架,强调了临床安全性的重要性。随着AI代理的逐步自主,传统的评估方法显得不够充分。该框架的发布将有助于推动医疗领域的AI发展,提升患者安全和服务质量。