国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:张莹,亚森·艾则孜,吴顺祥,
单位:1.新疆警察学院信息安全工程系,乌鲁木齐830011;2.厦门大学自动化系,福建厦门361005;
关键词:维吾尔语,文本相似性检测,N-gram统计模型,潜在语义分析,
基金:国家自然科学基金资助项目(61762086);新疆维吾尔自治区高校科研计划立项项目(XJEDU2016S090);;
为了实现维吾尔语文本的相似性检测,提出一种基于N-gram和语义分析的相似性检测方法。根据维吾尔语单词特征,采用了N-gram统计模型来获得词语,并根据词语在文本中的出现频率来构建词语—文本关系矩阵,并作为文本模型。采用了潜在语义分析(LSA)来获得词语及其文本之间的隐藏关联,以此解决维吾尔语词义模糊的问题,并获得准确的相似度。在包含重组和同义词替换的剽窃文本集上进行实验,结果表明该方法能够准确有效地检测出相似性。
来源:2019年第9期
《计算机应用研究》期刊编辑部