医学大语言模型通常在教学数据(如教材)和临床数据(如电子病历)混合训练。我们通过令牌匹配实验,系统地改变教学‑临床比例,评估数据构成对知识密集型任务和临床导向任务的性能、能力画像以及错误模式的影响。
实验揭示了任务类型之间的不对称迁移:加入临床数据显著提升临床导向任务的表现,同时在知识密集型任务上保持竞争力;而增加教学数据主要提升知识密集型任务的准确度。错误分析表明存在“知行差距”,即知识回忆的提升并不必然转化为临床推理能力的提升。
进一步观察到,少量临床数据即可带来大部分在基于电子健康记录任务上的收益,而最佳的教学‑临床比例取决于下游任务对知识和临床推理的需求。
这些结果提示,医学 LLM 的数据策划应以应用为导向:对推理密集型使用场景,倾向使用更高比例的临床数据。
点评