国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:韩士洋,马致远,杨芳艳,李想,汪伟,
单位:1.上海理工大学a.机器智能研究院;b.机械工程学院;c.光电信息与计算机工程学院,上海200093;2.南京大学计算机软件新技术国家重点实验室,南京210093;
关键词:成词信息,中文分词,标签嵌入,注意力机制,未登录词,
基金:南京大学计算机软件新技术国家重点实验室开放课题项目(KFKT2021B39);;
成词信息是一种对中文分词任务十分重要的文本特征。最新中文分词模型之一的WMSEG就是通过引入成词信息来获得最顶尖的分词性能。然而这类模型在建模时并未考虑标签之间的依赖关系,导致其分词性能特别是对未登录词的识别有所欠缺。针对这一问题,通过在学习过程中引入标签嵌入的注意力机制,提出了一种带标签注意力的成词记忆网络来增强标签之间的依赖关系以及标签和字符之间的相关性。实验结果表明,该模型在四个常用数据集上都取得了不弱于WMSEG的分词性能,同时提高了对未登录词的识别能力。
来源:2022年第6期
《计算机应用研究》期刊编辑部