NeFut Logo NeFut
EN 管理员登录

[AI学术] CuraWeb:联合优化网络规模预训练数据的质量、多样性与冗余

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#algorithm #Machine Learning #Open Source

摘要

开放网络语料库通过高度选择性的过滤器进行策划,例如 FineWeb-Edu 和 DCLM,构成了 LLM 预训练数据的核心,并显著提升了 LLM 的性能。然而,这些数据管道通常依赖于单一的优化目标,这不可避免地限制了分布多样性,并边缘化了长尾知识,从而限制了数据覆盖面,并未充分利用开放网络的巨大潜力。

为了解决这一局限性,我们提出了一种新的策划范式,转变为质量、冗余和多样性的联合优化。该框架将双轨清理(基于规则和基于模型)与混合去重(n-gram 和语义)相结合,同时采用多目标采样器来平衡信息质量与分布广度。我们将这一框架应用于 Common Crawl,构建了 CuraWeb,一个包含 2T 令牌的英语语料库。

与现有资源不同,CuraWeb 通过恢复更全面的数据分布,实现了增强的多样性和最小冗余,建立了工业级的数据策划标准,广泛覆盖了各个领域的长尾知识。在 3B 规模的实验评估中,CuraWeb 显著超越了最先进的基线,在广泛的基准测试中实现了平均 1.8\% 的性能提升,特别是在知识密集型和推理任务中。

博主点评: CuraWeb 的联合优化方法展现了数据策划的新视角,通过综合考虑质量、多样性和冗余,极大提升了预训练数据的有效性。这一创新策略为未来的 LLM 研究提供了新的方向,尤其是在长尾知识的覆盖方面,具有重要的实际意义。

原文链接: https://arxiv.org/abs/2607.22662

[h] 返回首页