基于可解释机器学习的前列腺癌风险预测模型构建OA
目的:通过使用临床医学数据,构建并验证多种机器学习预测模型,用于前列腺癌风险预测,旨在筛选出最佳性能模型,并验证其在国内外独立数据集的泛化能力,为前列腺癌的临床决策提供稳健、可信的工具。方法:选择国家人口健康科学数据中心的前列腺肿瘤患者临床数据,经高级特征筛选移除噪声数据后,按7:3划分训练集和测试集,构建5种机器学习模型,包括逻辑回归(logistic regression,LR)、极端梯度提升(extreme gradient boosting,XGBoost)、随机森林(random forest,RF)、分类特征梯度提升(categorical boosting,CatBoost)、K近邻(K-nearest neighbors,KNN)。在测试集上采用受试者工作特征曲线下面积(area under the receiver operating characteristic curve,AUC)、准确率、召回率及F1分数综合评价模型性能,同时评估模型在国外患者独立测试集的表现,最后利用SHAP对最佳模型进行特征重要性解析。结果:在五种模型中,XGBoost模型在内部测试集上表现最佳,其AUC、准确率、召回率及F1分数分别为0.894、0.852、0.825、0.834。SHAP分析显示,总PSA水平、碱性磷酸酶、年龄、肌酸激酶同工酶、游离总前列腺特异性抗原(prostate specific antigen,PSA)比值为最关键特征。同时,XGBoost模型在独立测试集上同样有着优异的性能(AUC:0.810),证明了其强大的泛化能力。结论:本研究构建了一个基于XGBoost的高性能、可解释的前列腺癌风险预测模型。该模型不仅在中国人群中表现出色,同时在国际数据中也表现出良好的普适性,可以为临床医生提供精准的风险分层,从而优化诊疗策略。
曹丽;王菁菁;武丽媛;赵国斌
河北北方学院研究生学院,张家口075000河北北方学院研究生学院,张家口075000河北北方学院研究生学院,张家口075000河北北方学院附属第一医院泌尿外科,张家口075000
医药卫生
前列腺癌机器学习SHAPXGBoost
《神经药理学报》 2026 (3)
P.28-39,12
河北省自然科学基金资助项目(No.H2021405012)。
评论