本文提出了一种新的预训练方法,称为 CellWorld,用于空间转录组学的基础模型。现有的空间转录组学基础模型主要通过重构掩蔽的基因身份或表达值来进行预训练,但是这种方法可能会导致技术变异性的复制和限制表示的转移性。为了避免直接重构这种变异性,我们将预测目标从观察到的基因测量值转移到潜在的细胞表示。CellWorld 预测的是掩蔽细胞的潜在表示,从可见的空间上下文和一个有限的部分表达提示中进行预测。我们预训练了四个 CellWorld 变体,参数数量从 5.74M 到 94.56M 不等,在 4600 万个人类细胞的语料库上进行训练。我们的受控缩放实验表明,性能会随着模型容量的增加而提高,特别是在空间任务中,而空间转移更依赖于充分的优化和广泛的生物源多样性,而不是单纯的细胞数量。在四个保留的数据集上,即使是 CellWorld-Small 模型,也优于所有基线模型,在所有 11 个线性探针基准和所有七个微调的空间基准上。最值得注意的是,仅在 5% 的语料库上预训练的 CellWorld-Large 模型,优于所有完全微调的基线模型,在所有七个空间基准上。代码可在 https://github.com/UoM-HealthAI/CellWorld 获取。 博主点评: 本文提出了一种新的预训练方法 CellWorld,用于空间转录组学的基础模型,通过预测潜在的细胞表示来避免直接重构技术变异性。实验结果表明,CellWorld 模型优于现有的基线模型,具有广泛的应用前景。