合成扰动被视为在生物医学机器学习中为LLM评审提供低成本校准数据的手段,因为专家审查资源稀缺。然而,植入的突变键既不是检测器输出,也不是自动化的人类真值。我们将相关实体正式划分为四类账本:植入扰动、独立检测器输出、来源关联的人类倾向以及人类新增的发现。随后,我们审计了一个私有的合成日语交接工作流的评估设计、评分代码、读取路径以及当前的人类记录。工厂在47个目标上存放了69张植入错误卡。最终审查覆盖22个目标,包含22条确认的导入提案、9条被拒提案和79条人类新增卡;仅有3个目标实现双重标注。将导入的植入键传递给通用检测器评分器得到的比例为22/(22+9)=0.710和22/(22+79)=0.218。直接审计身份表明,这些数值分别代表提案确认产出率和提交账本构成,而非评审的精确率与召回率,因为审计的提案在可用记录中未保留独立检测器实现。审计还发现了来源名称冲突、行遮蔽、强制严重度、空比默认以及不支持的零支持字段权重等问题。我们贡献了面向来源的声明审计、存储合约以及最低校准门槛,以负责任地传达生物医学机器学习能力声明。该单一工作流的取证案例证明了失效模式的存在,而非其普遍性估计:现有人类工作支持对合成提案的探索性审计,但不支持对LLM评审操作特性、临床有效性、语料库普遍性或稳健的标注者间一致性的评估。
点评