首页|期刊导航|陆军军医大学学报|SMOTEENN混合采样联合Stacking集成模型预测大学生抑郁倾向性能最优:基于类不平衡处理的84种模型比较

SMOTEENN混合采样联合Stacking集成模型预测大学生抑郁倾向性能最优:基于类不平衡处理的84种模型比较OA

中文摘要

目的针对大学生抑郁倾向预测中类不平衡问题导致模型对少数类识别不足的困境,系统比较7种过采样、欠采样与混合采样方法结合12种机器学习模型在音乐APP听歌习惯与大学生抑郁倾向类不平衡数据集上的预测效果,为类不平衡数据方法的选择提供参考。方法本研究采用横断面研究设计方案,资料来源于2023年全国29个省、自治区、直辖市的大学生问卷填写数据,大学生主要是年龄为18~24岁的在校本科生和研究生。采用单因素分析筛选出对大学生抑郁倾向有意义的10个特征;应用合成少数类过采样技术(synthetic minority over-sampling technique,SMOTE)、自适应合成采样方法(adaptive synthetic sampling approach,ADASYN)、高斯噪声合成少数类过采样技术(synthetic minority over-sampling technique for regression with Gaussian noise,SMOGN)3种过采样方法,编辑近邻法(edited nearest neighbors,ENN)、Tomek连接(Tomek Links)两种欠采样方法以及SMOTEENN、ADASYNTomek两种混合采样方法处理原始数据。原始数据与处理后的数据分别采用逻辑回归、支持向量机、随机森林、决策树、轻量梯度提升机、K近邻、极限梯度提升、Lasso逻辑回归、岭回归、弹性网络、多层感知机、Stacking集成模型等12种分类算法构建预测模型。选取受试者工作特征曲线下面积(area under curve,AUC)、召回率、F1评分、平衡准确率评价模型性能,比较不同类不平衡处理与机器学习组合策略以筛选最优模型。采用沙普利加性解释(SHapley Additive exPlanations,SHAP)方法对最优模型进行可解释性分析。结果单因素分析筛选出的10个特征为:大学生的性别、年级、专业类别、是否喜欢听“儿童”类型歌曲、开始有听歌习惯到现在的大概年限、是否喜欢听“国风”类型歌曲、平时听歌曲风、平均每天听歌时间、习惯听歌时间段、在音乐评论区留言频率。84种组合模型与原始数据的12种模型比较显示,7种采样方法中混合采样优于单一采样方法,SMOTEENN混合采样取得最优综合效果;在12种预测模型中,Stacking集成模型综合性能优于单一模型,其中SMOTEENN混合采样联合Stacking的组合模型性能最优(AUC=0.95,F1=0.89,召回率为0.88,平衡准确率为0.89)。SHAP分析显示“平时听歌曲风”对大学生抑郁倾向预测贡献度最高。结论基于84种组合模型的对比,SMOTEENN+Stacking集成模型能够准确预测大学生抑郁倾向。模型的对比分析为类不平衡数据场景下的方法选择及基于听歌行为数据的心理风险早期识别提供了方法学依据与实践参考。

屈壕;朱珲;黄馨巧;伍亚舟;徐晓晓;宋秋月

陆军军医大学(第三军医大学)军事预防医学系军队卫生统计学教研室,重庆陆军军医大学(第三军医大学)军事预防医学系军队卫生统计学教研室,重庆陆军军医大学(第三军医大学)军事预防医学系军队卫生统计学教研室,重庆陆军军医大学(第三军医大学)军事预防医学系军队卫生统计学教研室,重庆陆军军医大学(第三军医大学)医学心理系基础心理学教研室,重庆陆军军医大学(第三军医大学)军事预防医学系军队卫生统计学教研室,重庆

医药卫生

类不平衡机器学习听歌习惯抑郁倾向

《陆军军医大学学报》 2026 (15)

P.2214-2225,12

国家重点研发计划(2023YFC3605501)重庆市自然科学基金面上项目(CSTB2025NSCQ-GPX0648)。

10.16016/j.2097-0927.202603116

评论