国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:闫婧,赵迪,孟佳娜,林鸿飞,
单位:1.大连民族大学计算机科学与工程学院,辽宁大连116600;2.大连理工大学计算机科学与技术学院,辽宁大连116024;3.大连永佳电子技术有限公司,辽宁大连116024;
关键词:ICD编码分类,BioLinkBERT预训练模型,Mixup数据增强,扩张卷积,
基金:辽宁省自然科学基金资助项目(2022-BS-104);;
针对ICD编码分类任务存在的标签分布不平衡、临床记录文本过长和标签空间庞大等问题,提出一种基于数据增强和扩张卷积的ICD编码分类方法。首先,引入预训练模型BioLinkBERT,在生物医学领域采用无监督学习方式进行训练,以缓解域不匹配问题;其次,运用Mixup数据增强技术扩充隐藏表示,从而增加数据多样性及提升模型分类的鲁棒性,解决标签分布不平衡问题;最后,利用多粒度扩张卷积有效捕获文本数据中的长距离依赖关系,避免因输入文本过长影响模型效果。实验结果表明,该模型在MIMIC-Ⅲ数据集的两个子集上与多种方法进行比较,相较于基准模型的F1值和precision@k值分别提升0.4%~1.5%和1.2%~1.6%。因此,本研究为解决ICD编码分类中的挑战提供有效的解决方案。
来源:2024年第11期
《计算机应用研究》期刊编辑部