基于纵向联邦学习和大模型增强的跨机构数据融合优化OACHSSCD
[目的/意义]针对跨机构数据融合面临的数据主权让渡风险、特征异构稀疏以及隐私保护不足等问题,提出一种融合纵向联邦学习与大模型增强的跨机构数据融合优化模型(VFL-LBDA-DFOM),旨在保障数据隐私的前提下提升跨机构数据融合的效用与安全性。[方法/过程]首先,基于纵向联邦学习框架确保各机构原始数据在不出本地的前提下实现特征联合建模;其次,引入DeepSeek-V3大模型对本地稀疏特征进行生成式补全,以缓解特征稀疏与长尾分布问题;最后,将差分隐私随机梯度下降算法嵌入联邦训练过程,通过动态梯度裁剪、自适应噪声注入及隐私预算衰减策略,实现对梯度泄露风险的控制。仿真实验场景以中药领域为例,采用BERTBiLSTM-CRF作为本地分类模型。[结果/结论]结果表明,VFL-LBDA-DFOM在F1值和AUC上分别达到0.810和0.843,优于所有隐私约束条件下的基线模型,验证了跨机构数据融合优化的有效性。大模型数据增强模块对低资源类别建模效果提升显著,差分隐私优化机制能在分类精度与隐私保护间实现平衡,且存在最优扰动区间。进一步研究发现,过高噪声虽增强隐私保护,但会压制模型泛化能力。
窦路遥
中国科学院武汉文献情报中心,湖北武汉430071 中国科学院大学经济与管理学院信息资源管理系,北京100190
社会科学
纵向联邦学习数据融合大模型数据增强隐私保护
《现代情报》 2026 (8)
P.159-170,12
评论