无监督特征选择(UFS)旨在在没有标签的情况下挑选出紧凑且信息丰富的特征子集。传统方法往往依赖相似性保持、局部性、稀疏性、聚类几何或重构误差等间接结构准则。本文将 UFS 重新表述为特征层面的表示学习问题,提出逆对比学习框架 ICLFS。
ICLFS 首先对数据矩阵进行转置,使每个特征由其在所有样本上的取值向量(样本画像)表示。随后在该特征向量上生成多组掩码正视图,并构造一次随机置换得到的负视图。通过 InfoNCE 损失,学习投影空间的表示,使其在这些结构化扰动下保持一致。
受近期研究表明余弦相似度和 InfoNCE 训练会影响嵌入范数的启发,本文使用投影空间嵌入的模长作为特征重要性的显著性信号,对特征进行排序。随后引入拉普拉斯门控排序校正(Laplacian‑Gated Ranking Correction),在保留显著特征的同时抑制局部冗余特征。
在 12 个公开基准数据集上进行的大规模实验表明,ICLFS 在 10 个数据集上实现了最高的聚类准确率,优于传统和神经网络基线;在剩余两组数据上也保持竞争力。结果验证了特征层面对比表示一致性是邻域、聚类和重构等传统 UFS 方案的有力替代方案。
点评