在罕见疾病的表型驱动诊断基准中,通常只报告参考疾病的排名,而很少揭示哪些合理的替代方案排名更高,或工具使用模型在做出决策前检查了哪些证据。我们引入了 GraphRareBench,这是一个保留来源的基准,包含 2365 个基于本体的案例和 18093 对目标-混淆因子。每个案例包括一个粗化的 HPO 查询、固定的候选池、图定义的硬混淆因子和源链接的证据记录。在 237 个案例的基因组件不重叠测试分集中,使用共享 21 特征接口的监督排序器实现了从 0.640 到 0.740 的 MRR,目标-混淆因子平均准确率范围为 0.898 到 0.916。实例化为 Agents-A1 和 DeepSeek-V4-Flash 的代理分别实现了 0.746 和 0.718 的 MRR;它们的配对 MRR 差异没有统计学意义,而它们的目标-证据覆盖率则相差 0.561。结合观察到的 22.1% 到 43.7% 的 Hit@10 成功案例仍将至少一个图定义的硬混淆因子排名高于目标,这些结果表明,完整池检索、硬混淆因子区分和可观察证据访问捕捉了模型行为的互补方面。因此,GraphRareBench 为更透明和证据驱动的表型驱动诊断系统评估提供了基础。代码和数据可在 GitHub 获取。
博主点评: GraphRareBench 的提出为罕见疾病的诊断提供了新的思路,强调了模型透明度和对证据的访问,能够更好地支持临床决策。通过量化混淆因子的影响,该基准为未来的研究奠定了重要基础,值得关注和深入探讨。