在单细胞数据集中,存储、审计和重用的成本日益增加。尽管降维和数据集蒸馏可以减轻这一负担,但传统的蒸馏方法往往生成无法追溯到实际细胞的合成表达谱。我们将可追溯的单细胞数据蒸馏定义为在固定的细胞和基因预算下保留原始细胞标识符和基因符号。所得到的训练子集与测量的计数、标签和测定元数据保持连接,因此可以针对意外的预测检查其源数据。
我们提出了两种真实细胞选择器。固定特征函数(Fixed-CF)使用静态特征函数匹配,而最小-最大特征函数(Minmax-CF)解决了一个熵正则化的离散最小-最大问题,强调保留不足的方向,并仅添加已观察到的细胞。
在三组数据集上进行的捐赠者、技术和扰动水平的变化中,Minmax-CF在MS上保留了96.52%的完整平衡准确率,在hPancreas上平均约匹配完整准确率,且在所有基因设置中获得了中位数$2.55\times$的GPU加速,同时在Norman的压缩方法中获得了最低路径误差。
对于稀有状态、某些技术变化、未见扰动成分以及保真度与下游效用弱相关的设置,性能表现较弱。由于所选ID指向已测量的细胞,因此可以通过检查相应的训练支持、标签和测定元数据来调查这些情况。Minmax-CF始终减少最差方向的差异,而下游效用和成本在不同数据集和任务中有所不同。
博主点评: 本文提出的Minmax-CF方法在保证数据可追溯性的同时,显著提高了训练效率,展示了在生物信息学领域中数据蒸馏的潜力。通过解决细胞和基因预算问题,研究者为未来的单细胞数据分析提供了新的思路与工具。