多轮强化学习驱动的Web服务增强分类OA
针对Web服务分类中长尾分布导致的尾部类别识别困难问题,本文提出一种融合强化学习的多轮数据增强与自适应损失优化方法。该方法以大语言模型为语义生成核心,构建强化学习智能体,在每一轮迭代中根据环境状态自适应地调整不同类别的增强比例与筛选阈值,增强“生成-评估-筛选-回流”的多轮闭环数据;同时结合思维链推理机制,从新颖性、一致性和推理质量等多维度评估生成样本,过滤模板化和语义漂移样本,逐轮优化训练数据分布。在分类器训练阶段,本文基于当轮增强后训练集的类别频次动态计算类权重,并设计Top-k Near-Miss Focal Loss损失函数,联合刻画长尾类别与近错样本,对边界语义进行重点惩罚,从而实现面向长尾与难例的自适应损失优化。在真实长尾Web服务数据集、PMTD(Productive Math Tutoring Dialogue)教学对话数据集上进行实验,结果表明,本文方法在多项评估指标上均优于NCAL(Neural-collapse-advanced Personalized Learning)、RGPT(Recurrent Generative Pre-trained Transformer)、SRaSLR(Social Relation Aware Service Label Recommendation Model)、LLMEmbed等基线模型,尤其在尾部类别识别方面表现突出:在多个轻量级模型上,Web数据集上Macro-F_(1)提升最高达5个百分点,Weighted-F_(1)提升约2~3个百分点。本文研究成果有效缓解了长尾数据分布带来的类别偏置问题,为开放环境下语义稀疏服务的智能识别与分类提供了可行路径。
何慧敏;陈翀;王涛;程良伦
广东工业大学计算机学院,广东广州510006广东工业大学计算机学院,广东广州510006广东工业大学自动化学院,广东广州510006广东工业大学计算机学院,广东广州510006
信息技术与安全科学
大语言模型多轮数据增强强化学习推理机制长尾分布
《广东工业大学学报》 2026 (4)
P.80-90,11
国家自然科学基金联合基金资助项目(U20A6003)。
评论