本论文介绍了一款基于人工智能的浏览器扩展 ClickGuard,旨在识别点击诱饵内容,帮助用户避免误导性的互联网文章。该应用超越了传统的检测方法,采用了一种混合机器学习架构,结合了基于变换器的嵌入、语言学驱动的特征以及自定义的“诱饵性”评分。在评估了多种自然语言处理技术后,从经典的向量化方法到大型语言模型(LLM)嵌入,最终开发出一个基于 XGBoost 的模型,在开放的综合数据集上达到了 91% 的 F1 分数。
更重要的是,该工具能够在用户访问点击诱饵文章之前和之后发出警告。打开文章后,用户会收到一个百分比评分,指示该文章为点击诱饵的可能性。该预测将基于分析的指标进行解释,包括在提议系统中专门开发的指标。此外,浏览器扩展还提供了点击诱饵的剧透——对整篇文章的一至两句总结。
Demo 视频:ClickGuard Demo
博主点评: ClickGuard 的创新之处在于其结合了传统 NLP 方法与现代深度学习技术,显著提高了点击诱饵的检测精度。通过提供量化评分和摘要功能,用户不仅能避免误导性信息,还能快速获取文章核心内容,实用性强。未来,随着模型的不断优化,期待其在更广泛的场景中应用。