我们开发了一个面向支架的多代理大型语言模型(LLM)AI 标准化患者(AI‑SP)训练平台。系统包括模拟对话的患者代理、提供苏格拉底式提示且不泄露诊断信息的导师代理,以及在回合层面监控临床进展且不显示汇总分数的评估代理。
随机对照研究招募 100 名医学生,随机分配到多代理支架组或对照组。所有学生在各自条件下完成两次学习会话,随后在仅患者环境中进行考核。考核使用客观结构化临床考试(OSCE)评分表。
结果显示,两组在最终诊断准确率上无显著差异,但多代理 AI‑SP 系统在总分上高于对照组,尤其在沟通、共情表达和特定病史采集行为上提升最为明显。研究表明,专门的 LLM 代理能够提升模拟临床访谈的过程质量,而不会人为抬高考试成绩。
为促进后续研究,我们公开了包含对话转录、检查清单标注、回合层面评估以及与 OSCE 对齐的评分结果的多专家标注数据集,旨在支持教学导向的 AI‑SP 系统开发和 AI 辅助临床推理训练的研究。
点评:该平台展示了多代理协同在医学教育中的潜力,为可扩展的临床面试训练提供了新路径。