NeFut Logo NeFut
EN 管理员登录

[AI学术] 构建与评估医学代理的临床推理轨迹

发布于:2026-09-08 22:00 最后更新:2026-09-09 09:08
#AI #Machine Learning #Artificial Intelligence

MedTraj 将推理轨迹视为可构建、可评估、可优化的核心对象。首先从医学推理资料生成结构化的多步链,每条轨迹被解析为临床观察、证据、编号推理步骤和最终结论。随后在连贯性、证据支撑、幻觉、完整性、可追溯性五个维度上打分。通过受控错误注入,在本应正确的轨迹中加入特定缺陷,以建立特定推理失误与质量下降的因果关联。基于边际贡献的步级过滤识别出推动或削弱轨迹质量的关键步骤。最后,质量加权的上下文学习在推理时将轨迹评估结果反馈给模型,使其既能学习强示例,也能避免弱示例。实验在 CareQA、PubMedQA、CECMed 上进行,结果显示轨迹上下文始终提升连贯性,提升幅度为 0.029~0.041。CECMed 上质量加权上下文使正确率几乎翻倍,幻觉率下降 87%。边际贡献分析表明少数步骤贡献大部分质量信号,超过四步的链路收益递减。

点评

原文链接: https://arxiv.org/abs/2609.05090

[h] 返回首页