NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破性方法:利用部分裁决的设计基础监督学习纠正嘈杂人类标签

发布于:2026-07-20 22:00 最后更新:2026-07-22 01:02
#AI #Machine Learning #optimization

摘要

研究人员越来越多地使用自动分类器对非结构化数据进行标记,以进行统计分析。现有的修正方法可以利用概率抽样的审计集来纠正这些自动标签中的错误,但通常将审计标签视为正确。然而,在实际操作中,人类审计标签往往是嘈杂的,并且只有部分审核项目经过专家或裁决者审查。

我们提出了一种名为部分裁决的设计基础监督学习(PA-DSL)的方法,适用于这种情况。该方法利用经过裁决的案例来纠正嘈杂的人类标签,然后使用修正后的审计信息来消除基于全自动标签集的分析偏差。当审计和裁决概率已知时,该估计器对广泛的下游分析是有效的。在合成和维基百科 Detox 的半合成实验中,PA-DSL 维持了名义覆盖率,并在嘈杂的人类标签包含可恢复信号时,相较于仅使用裁决标签减少了 10-17% 的均方根误差(RMSE)。

博主点评: PA-DSL 方法引入了对嘈杂人类标签的有效纠正机制,解决了传统监督学习中的标签可靠性问题,具有重要的实用价值和广泛的应用潜力。

原文链接: https://arxiv.org/abs/2607.15455

[h] 返回首页