国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:郑静益,邓晓衡,
单位:中南大学软件学院,长沙410075;
关键词:频繁项集挖掘,Apriori算法,大数据,分布式计算,
基金:中南大学研究生科研创新项目(2017zzts612);;
Apriori算法是解决频繁项集挖掘最常用的算法之一,但多轮迭代扫描完整数据集的计算方式,严重影响算法效率且难以并行化处理。随着数据规模的持续增大,这一问题日益严重。针对这一问题,提出了一种基于项编码和Spark计算框架的Apriori并行化处理方法——IEBDA算法,利用项编码完整保存项集信息,在不重复扫描完整数据集的情况下完成频繁项集挖掘,同时利用Spark的广播变量实现并行化处理。与其他分布式Apriori算法在不同规模的数据集上进行性能比较,发现IEBDA算法从第一轮迭代后加速效果明显。结果表明,该算法可以提高大数据环境下多轮迭代的频繁项集挖掘效率。
来源:2019年第4期
《计算机应用研究》期刊编辑部