声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:刘伟童,刘培玉,刘文锋,李娜娜,
单位:1.山东师范大学信息科学与工程学院,济南250358;2.山东省分布式计算机软件新技术重点实验室,济南250358;3.菏泽学院计算机学院,山东菏泽274015;
关键词:新词发现,互信息,邻接熵,微博语料,
基金:国家自然科学基金资助项目(61373148,61502151);山东省社科规划项目(17CHLJ18,17CHLJ33,17CHLJ30);山东省自然科学基金资助项目(ZR2014FL010);山东省教育厅基金资助项目(J15LN34);;
如何快速高效地识别新词是自然语言处理中一项非常重要的任务。针对当前新词发现存在的问题,提出了一种从左至右逐字在未切词的微博语料中发现新词的算法。通过计算候选词语与其右邻接字的互信息来逐字扩展,得到候选新词;并通过计算邻接熵、删除候选新词的首尾停用词和过滤旧词语等方法来过滤候选新词,最终得到新词集。解决了因切词错误导致部分新词无法识别以及通过n-gram方法导致大量重复词串和垃圾词串识别为新词的问题。最后通过实验验证了该算法的有效性。
来源:2019年第5期
《计算机应用研究》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。