在编码代理需要工程师监督,或临床模型协助放射科医生的场景中,部署的核心问题是:是保留人‑AI 工作流,还是改为仅人类或仅代理?只有当人‑AI 工作流同时优于“仅人类”和“仅代理”两种基线时,才值得保留。然而一旦系统上线,另一种基线的表现并不会自然出现:要获取它,需要在相同任务上重新运行,且每次重跑都消耗专家时间或计算资源。
在固定的重跑预算下,设计问题转化为:哪些任务更应该分配给人类‑仅重跑,哪些应该分配给代理‑仅重跑?现有方法并未直接针对这一决策。传统的代理基准测试往往不明确缺失的基线,基于方差的抽样只关注哪种比较更不确定,却忽略了两者哪一个更接近失败;贝叶斯信息准则则侧重于学习模型参数,而非帮助做出部署决策。
我们提出 TEAM-Design 规则,为每个任务生成两条重跑概率,分别对应人类基线和代理基线。该规则在缺失基线结果难以从已有信息预测且比较更难以确定时提升对应概率,在重跑成本高时降低概率。我们证明该规则在预算约束下能够最优分配重跑次数,并且即使按照记录的概率随机抽取重跑,也能控制错误宣称工作流同时优于两种基线的概率。
我们对 6 种临床场景(均未出现人‑AI 工作流同时优于两种基线)以及一个编码基准(出现了此类工作流)进行了再分析,并在合成设计以及基于真实胸片阅读实验的半合成设计上评估了 TEAM-Design。实验表明,当两种比较中有一项明显更难以判定时,TEAM-Design 表现最佳;而在两者难度相近的情况下,其效果可能不如基于方差的分配。
点评:TEAM-Design 为预算受限的部署评估提供了明确的决策指引,尤其适用于比较不平衡的基线场景。但在基线难度相当时仍需结合其他采样策略以提升效率。