临床诊断代理不仅要决定下一步请求哪项检查,还必须判断何时给出诊断或转交。现有基准大多在固定或不受约束的交互后评估准确率,停机可靠性被隐含忽略。我们提出 Cros——一种风险约束的停机层,结合状态误差排序、在互不重叠的开发划分上设计策略,以及 LTT 风格的精确检验,用于选择性诊断错误和最小自主覆盖率的完整顺序策略。其有限样本保证要求候选族、检验规则以及任何随机化在访问标注前就被冻结。实验在 1,834 条 MIMIC 派生的腹痛基准上进行,完整排序器的探索性状态误差 AUROC 为 0.853,显著高于最大类别概率的 0.715 和骨干网络原生停机分数的 0.552。对先前查看的 367 条评估划分进行分析,冻结的 Cros 权重平均后得到 16.9% 的选择性错误率,覆盖率 78.8%,成本 5.57,平均检验次数 0.68;相比之下,原生停机在 100% 覆盖下错误率 30.8%,成本 8.14,检验次数 1.53。强制继续的效果并非单调:仅使用 HPI 时错误率 28.3%,完整检查后升至 34.3%。尽管缺少锁定的开发边界,均匀权重混合的消融实验在该划分上更省成本,而 Cros 仅在 20 次开发重划分中有 6 次满足联合准则。由于评估标签在早期开发阶段已被检查,这些结果提供的是探索性可行性和审计证据,而非确认性的安全证书。
点评