欺诈职位发布检测旨在发现包含虚假内容、误导信息或负面意图的招聘广告,这类信息会破坏求职者和雇主的在线生态系统。现有方法往往只能在分类准确率上取得进展,却难以在潜在空间中形成有意义的结构,导致对细微差别的捕捉不足。为此我们提出 Centroid-Guided Contrastive Loss (CGCL),它将分类任务与密集聚类统一到同一损失函数中,通过中心点驱动的 top‑$k$ 拉拽机制持续重塑潜在空间。CGCL 的核心思想是:
- 对每个类别计算其特征中心(centroid),
- 对每个样本的特征向量,选取与其所属中心最近的 $k$ 个负中心进行拉远(push),
- 同时对正中心进行拉近(pull),
- 将上述拉拽项与交叉熵分类损失相加,实现决策边界的精确划分与聚类紧凑性的同步提升。
该机制保证了类间可分离性和类内结构的双重约束,使模型在保持高分类准确率的同时,潜在空间的簇形态更加紧凑且易于解释。我们在公开基准数据集 EMSCAD 上进行广泛实验,结果显示 CGCL 在准确率、F1 分数以及聚类指标(如 Silhouette)上均显著超越现有 SOTA 方法。代码已开源于 https://github.com/ali-ahmed925/CGCL_code,便于复现与后续研究。
点评