国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:霍浩鑫,管卫利,方志杰,
单位:1.广西大学计算机与电子信息学院,南宁530004;2.南宁学院数字与经济学院,南宁530299;3.广西科技大学电子工程学院,广西柳州545006;
关键词:文本分类,数据增强,大语言模型,知识迁移,
基金:国家自然科学基金资助项目(12364011);广西科技计划资助项目(25069027);中央引导地方科技发展专项资金资助项目(2023PRJ1013);柳州市科技计划资助项目(2024AA0204A001);;
针对传统数据增强方法仅在数据层面操作,难以突破语义空间封闭性的问题,提出了一种基于 DeepSeek 的文本增强框架(DS-Aug)。该框架利用推理链提示模板生成语义一致且具领域特异性的增强样本和蒸馏知识,并设计知识感知迁移融合模型,通过注意力门控机制动态注入领域相关外部知识,从而提升模型的知识迁移与小样本学习能力。在 BBC 新闻主题分类和 MR 影评情感分析两个公开数据集上的实验结果表明,DS-Aug 在准确率和F1 分数上均优于传统增强方法和部分预训练模型。结果验证了 DS-Aug 在提升分类性能方面的有效性,尤其在小样本与跨领域任务中表现出较强的鲁棒性。该研究为开源大语言模型在领域文本分类中的应用提供了新的思路与参考。
来源:2026年第3期
《计算机应用研究》期刊编辑部