国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:王源龙,孙卫真,向勇,
单位:1.首都师范大学信息工程学院计算机科学与技术系,北京100048;2.清华大学计算机科学与技术系,北京100084;
关键词:集成学习,协同过滤,稀疏性,扩展性,Spark流式计算,增量模型,分类,
基金:北京市教委科技计划项目(KM201310028014);;
针对传统协同过滤在推荐过程中存在的稀疏性、扩展性以及个性化问题,通过引入算法集成的思想,旨在优化和改进一种新型的基于Spark平台下的混合协同过滤。借鉴Stacking集成学习思想,将多个弱推荐器线性加权组合,形成综合性强的推荐器。算法基于近邻协同过滤,结合分类、流行度、好评度等对近邻相似度计算策略进行优化,旨在改善相似度的合理性以及相似度计算的复杂度,在一定程度上改善了评分稀疏性的问题;算法结合Spark分布式计算平台,充分借鉴分布式平台的优点,利用其流式处理以及分布式存储结构等特性,设计并实现一种推荐算法的增量迭型,解决了协同过滤算法扩展性和实时性问题。实验数据采用UCI公用数据集MovieLens和NetFlix电影评分数据。实验结果表明,改进算法在推荐个性化、准确率以及扩展性上都有不错的表现,较以前同类型算法均有不同程度的提高,为推荐系统的应用提供一种可行的算法集成方案。
来源:2019年第3期
《计算机应用研究》期刊编辑部