首页|期刊导航|电子学报|面向医疗缺失数据的选择性学习

面向医疗缺失数据的选择性学习OA

中文摘要

现实世界中的数据普遍存在缺失,此类数据缺失问题会显著劣化机器学习模型的性能表现。应对数据缺失的代表性方法为数据插补,即基于已观测到的数据对缺失数据进行估计,进而利用插补后的完整数据开展模型训练。然而,若插补过程中存在估计偏差,则可能引入额外噪声,往往会阻碍模型的学习过程。例如,低质量的插补往往带有估计偏差,这会影响数据的真实分布。模型若基于这些有偏样本建立映射关系,将难以捕捉数据的本质规律,进而导致泛化性能显著衰减。为此,本文提出了一种新的处理缺失数据的方法——面向缺失数据的选择性学习(Selective Learning for Incomplete Data,SLID),旨在有效利用缺失数据进行学习。SLID致力于构建一个能够动态感知数据质量的可靠学习框架。该方法在训练过程中引入动态评估机制,将被动接受插补数据转变为主动筛选:对于高置信度的插补样本,模型将其作为有效特征进行充分学习;而对于低置信度的样本,则引入正则化策略将其视为不可靠信息进行平滑处理。通过这种选择性学习机制,有效地规避了对有偏分布的过拟合,从而显著提升了泛化性能。基于多个数据集上的大量实验结果表明,与以往方法相比,SLID在准确性与可靠性方面均取得了显著提升。

韩宗博;西雨晗;盛培卓;廖芸;张长青

北京邮电大学信息与通信工程学院,北京100876天津科技大学人工智能学院,天津300457天津大学人工智能学院,天津300354天津科技大学人工智能学院,天津300457天津大学人工智能学院,天津300354

信息技术与安全科学

选择性学习缺失数据插补低质量样本

《电子学报》 2026 (4)

P.1775-1788,14

国家重点研发计划(No.2025YFF0515300)国家自然科学基金(No.624B2100)。

10.12263/DZXB.20260303

评论