在这篇论文中,研究者探讨了预训练数据被污染的可能性,这种污染会导致语言模型(LM)出现难以检测和缓解的有害行为。以往的研究主要集中在如维基百科等已建立的数据源,这些数据源并不能代表预训练语料的广泛规模和异质性,同时忽略了污染数据与数据管理流程之间的相互作用。
我们展示了通过现有的网络规模内容注入机制——公共讨论接口,进行预训练数据污染攻击是可行的。此外,为了衡量在网络爬虫和数据管理后,恶意内容是否被包含在内,我们引入了HalfLife,这是一种新颖的分析方法,用于估算对抗性内容在基于网络爬虫的语言模型训练数据中的包含情况。
使用HalfLife,我们探索了通过开放讨论接口在网络规模上污染预训练语料的可行性。我们的分析表明,估算污染注入是否包含在预训练数据中至关重要,并确立了第三方网页内容作为攻击语言模型预训练的潜在途径。
博主点评: 这项研究揭示了预训练数据污染的严重性,尤其是在开放讨论平台的环境下。随着语言模型的广泛应用,确保训练数据的安全性和可靠性显得尤为重要,未来需要更多的关注和技术手段来防范这种潜在威胁。