摘要
雌激素受体(ER)状态是乳腺癌诊断、预后和治疗选择中的关键生物标志物。近年来,高通量测序技术的进步使得生成多组学数据集成为可能,这些数据集为计算预测任务提供了互补的分子信息。本研究系统评估了经典机器学习模型在使用来自TCGA-BRCA队列的转录组(RNA表达)、基因组(拷贝数变异;CNV)和蛋白组(RPPA)数据进行ER状态预测的表现。
方法
我们采用了严格的实验框架,包括分层训练-测试划分、分层五折交叉验证、类别不平衡处理和折特定特征选择,以确保可靠的评估并防止数据泄漏。评估的模型包括随机森林、XGBoost、LightGBM、CatBoost、支持向量机(SVM)和逻辑回归,比较了单组学和多组学设置下的表现。
结果
结果表明,RNA表达提供了最强的预测信号,而多组学整合在个体模态上取得了一定但持续的改进。在所有评估的方法中,随机森林在整合的多组学设置中实现了最佳的整体性能,获得了90.3%的平衡准确率和97.1%的ROC-AUC。此外,反复选择生物相关基因,包括 ESR1、PGR、FOXA1 和 GATA3,支持了学习模型的生物有效性。这些发现表明,经过精心正则化的经典机器学习方法在小型高维基因组数据集中仍然非常有效,而多组学整合为乳腺癌ER状态预测提供了互补的信息。
博主点评: 本文通过系统的基准测试展示了多组学数据在乳腺癌预测中的重要性,强调了经典机器学习算法在高维数据处理中的有效性,尤其是随机森林的突出表现,值得在临床应用中进一步探索。