首页|期刊导航|吉林大学学报(信息科学版)|基于爬虫技术的电商网页关联数据自适应挖掘算法

基于爬虫技术的电商网页关联数据自适应挖掘算法OA

中文摘要

为有效挖掘和利用网页数据,以爬虫技术为支持,提出一种关联数据自适应挖掘算法。利用爬虫技术爬取电商网页,突破数据获取限制,将所需数据以结构化格式存储至数据库,为后续处理提供有序数据基础。基于存储在数据库中的稀疏数据,依据最小支持度并运用Apriori算法,并通过剪枝策略,在减少数据处理量的同时,能在稀疏数据中精准找出频繁项集,成功解决传统方法因数据稀疏难以获取频繁项集的问题。以树形结构为框架,将Apriori算法得到的频繁项集作为结点,通过自适应结合旧结点与新结点构建挖掘树,直至无结点可结合,使其生成的挖掘树全面呈现数据关联关系,进而得到充分且精准的电商网页关联数据挖掘结果。经在大型电商网站的网页上验证后表明,所提算法能确保网页爬取的完整性,准确获得以购买行为为目标的频繁项集,精准挖掘电商网页中的关联数据,在为电商平台运营提供有益参考的同时,给予商家和消费者更好的决策支持。

王琪

黑龙江财经学院财经信息工程学院,哈尔滨150025

信息技术与安全科学

电商网页数据爬虫技术网页数据爬取频繁项集树形结构自适应挖掘

《吉林大学学报(信息科学版)》 2026 (4)

P.991-997,7

黑龙江省教育科学规划重点课题基金资助项目(GJB1424318)。

评论