在利用通用弱点枚举(CWE)分类网络安全漏洞时,由于类别极度不平衡和弱点类别之间强烈的层次依赖关系,面临诸多挑战。虽然合成少数类过采样技术(如 SMOTE 和 ADASYN)被广泛应用于缓解类别不平衡,但其在层次化 CWE 文本分类中的有效性尚未得到充分探索。
本文提出了一种层次感知的 RoBERTa 框架,显式地通过可学习的父类嵌入来整合 CWE 结构信息,从而保持分类法的一致性。我们的实验表明,在高维嵌入空间中的合成插值违反了 CWE 层次结构的内在父子约束,虽然对经典的机器学习模型提供了边际利益,但却始终削弱了深度学习架构的表现。
在 CWE 研究概念数据集上评估后,所提模型在不进行数据增强的情况下,达到了 0.76 的加权 F1 分数,超越了所有基线,特别是在少数类上取得了显著提升,其中类别的 F1 分数从 0.40 提升至 0.60,较 BERT 基线表现更为优异。我们的结果表明,层次感知的表示学习是结构化漏洞分类中更为合理的替代方案,而非简单的过采样。
博主点评: 本文通过引入层次感知的表示学习方法,为解决类别不平衡问题提供了新的思路,尤其在深度学习架构中的应用,展现了良好的效果,值得相关领域深入研究与应用。