国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:冯兴杰,潘轩,
单位:中国民航大学a.计算机科学与技术学院;b.信息网络中心,天津300300;
关键词:关联规则挖掘,大数据,Spark,投影树,并行化,
基金:国家自然科学基金委员会与中国民用航空局联合基金项目(U1233113);国家自然科学基金青年基金资助项目(61301245,61201414);;
通过对Spark大数据平台以及Eclat算法的深入分析,提出了基于Spark的Eclat算法(即SPEclat)。针对串行算法在处理大规模数据时出现的不足,该方法在多方面进行改进:为减少候选项集支持度计数带来的损耗,改变了数据的存储方式;将数据按前缀进行分组,并划分到不同的计算节点,压缩数据的搜索空间,实现并行化计算。最终将算法结合Spark云计算平台的优势加以实现。实验表明该算法可在处理海量数据集时高效运行,并且在面对数据量大规模增长的情况下具备良好的可扩展性。
来源:2019年第1期
《计算机应用研究》期刊编辑部