国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:如先姑力·阿布都热西提,亚森·艾则孜,郭文强,
单位:1.新疆警察学院信息安全工程系,乌鲁木齐830013;2.新疆财经大学计算机科学与工程学院,乌鲁木齐830013;
关键词:维吾尔语网页,不良文本过滤,n-gram词干提取,类不平衡SVM,
基金:国家自然科学基金资助项目(61762086);新疆维吾尔自治区高校科研计划项目(XJEDU2017M046);国家社会科学基金资助项目(13CFX055);;
提出了一种结合n-gram统计模型和类不平衡支持向量机(SVM)分类器的维语文本过滤方法。首先,将网页文本进行预处理操作,通过n-gram统计模型来初步提取词干;然后,对词干进行语义分析,将具有相似含义的词干聚合为一类,以此降低词干维度;最后,在传统SVM中引入一个控制超平面之间距离的参数,构建一种类不平衡SVM,使其能够很好地分类具有非线性不可分和不平衡性的维吾尔语文本。实验结果表明,该方法能够准确分类出不良文本,且具有较短的分类时间。
来源:2019年第11期
《计算机应用研究》期刊编辑部