NeFut Logo NeFut
EN 管理员登录

[AI学术] OriginBlame:AI训练数据集的记录和标记级数据来源追踪

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#algorithm #AI #Data Structure

在数据贡献者请求移除时,模型训练者面临着实际的空白:去学习算法需要一个遗忘集,但没有工具可以定位哪些训练记录属于特定作者。现有的来源系统仅在文件或数据集层面操作,导致灾难性的过度删除。我们提出了 ob,一个记录和标记级数据来源系统,它通过数据处理管道传播作者身份,并通过确定性查询将撤销请求解析为精确的遗忘集。

对 219,555 个维基百科页面的评估表明,记录级来源消除了数据集级的过度删除(从 101 倍减少到 1.3 倍),而集成在 HuggingFace 上增加了 1.3-4.0% 的吞吐量开销,在 Datatrove 上增加了 2.1-19.0%。在一个 17 亿参数的模型上,基于来源的遗忘集比随机基线提高了 42% 的去学习效果。

博主点评: OriginBlame 提供了一种创新的方法来解决数据删除的挑战,显著降低了过度删除的风险,同时保持了系统的高效性。这种方法不仅提高了用户隐私保护的能力,还为未来的 AI 数据管理奠定了基础,值得关注和研究。

原文链接: https://arxiv.org/abs/2607.13037

[h] 返回首页