NeFut Logo NeFut
EN 管理员登录

[AI学术] FindMyText:在大规模网络爬虫数据中稳健检测文本包含

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#algorithm #optimization #Open Source

FindMyText 是一个开源 Python 包,旨在高效评估给定文本是否部分或完全出现在文本语料库中。该工具建立在文档指纹技术的基础上,但通过一种新机制显著增强了对匹配指纹序列的捕获。

通过识别这些链,FindMyText 可以更可靠地检测给定文本的近乎逐字复制,而不仅仅是文本相似性。这使得 FindMyText 特别适合验证语料库中版权材料的存在。

该系统利用分布式、基于磁盘的索引框架,能够扩展到大型网络爬虫数据集。通过新的基准评估文本包含方法,我们展示了 FindMyText 在三个数据集(ArXiv 论文、维基百科和通用网页内容)中优于其他方法的表现。

博主点评: FindMyText 的创新之处在于其对文档指纹技术的扩展,能够更精准地识别版权材料。这种方法不仅提高了文本检测的准确性,还使其在处理大规模数据集时具备了良好的可扩展性,具有广泛的应用前景。值得关注的是其开源特性,将为研究者提供更多的实验和改进空间。

原文链接: https://arxiv.org/abs/2607.10020

[h] 返回首页