Web 应用正受到利用 HTTP 请求规避安全防护的攻击。传统 WAF 多采用规则,误报高且适应性差。近年来机器学习和词向量被用于提升异常检测。本文构建了一个统一的单类分类基准,比较 Word2Vec、FastText、Doc2Vec 三种静态嵌入模型。我们提出 HEDA(HTTP Embedding‑Based Detection Architecture),其核心是将嵌入向量输入单类异常检测器,对每条请求进行判别。整个流程在无监督环境下运行,嵌入模型和检测器仅使用正常流量训练。实验在三套特征各异的数据集上完成,包含合成流量和真实流量。结果表明嵌入选择对检测效果影响显著,FastText 在所有数据集上表现最稳健,能够在保持低误报的同时实现高检测率。
点评