国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:徐春,吉双焱,马志龙,
单位:新疆财经大学信息管理学院,乌鲁木齐830012;
关键词:自动ICD编码,小样本学习,提示学习,超球原型,预训练语言模型,
基金:国家自然科学基金资助项目(62266041);新疆自然科学基金资助项目(2023D01A73);;
针对国际疾病分类(ICD)自动编码方法的长文本处理、编码的层次结构以及长尾分布等导致的模型泛化能力弱的问题,提出一种充分利用医学预训练语言模型的基于提示学习和超球原型的小样本ICD自动编码方法(hypersphere prototypical with prompt learning,PromptHP)。首先,将编码描述与临床文本融合进提示学习模型中的提示模板,使得模型能够更加深入地理解临床文本;然后,充分利用预训练语言模型的先验知识进行初始预测;接着,在预训练语言模型输出表示的基础上引入超球原型进行类别建模和度量分类,并在医学数据集上微调网络,充分纳入数据知识,提高模型在小样本ICD编码分配任务上的性能;最后,对以上两部分预测结果集成加权获得最终编码预测结果。在公开医学数据集MIMIC-Ⅲ上的实验结果表明,该模型优于最先进的基线方法,PromptHP将小样本编码的macro-AUC、micro-AUC、macro-F1和micro-F1分别提高了1.77%、1.54%、14.22%、15.01%。实验结果验证了该模型在小样本编码分类任务中的有效性。
来源:2024年第9期
《计算机应用研究》期刊编辑部