国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:恩卡尔·奴尔太,马博,王震,艾孜麦提·艾尼瓦尔,吐尔洪·吾司曼,杨雅婷,
单位:1.中国科学院新疆理化技术研究所,乌鲁木齐830011;2.中国科学院大学,北京100049;3.新疆民族语音语言信息处理实验室,乌鲁木齐830011;
关键词:易混淆样本,短文本聚类,大语言模型,对比学习,
基金:天山英才培养计划项目(2023TSYCCX0041,2022TSYCCX0059);新疆维吾尔自治区自然科学基金资助项目(2022D01D81,2022D01D04,2022D01B207);新疆维吾尔自治区重点研发计划项目(2023B03024);中国科学院青年创新促进会资助项目(Y2021112,Y2023118);新疆维吾尔自治区上海合作组织科技伙伴计划及国际科技合作计划项目(2023E01019);;
短文本聚类旨在将无标签的短文本实例划分为不同的语义簇。针对该任务中易混淆样本难以有效区分以及语义相近簇间特征分布重叠的挑战,提出了一种易混淆样本驱动的簇间分布优化短文本聚类方法。该方法首先基于信息熵采样不确定性较高的样本作为易混淆样本,并选取其邻近簇样本构建候选集;随后引入大语言模型进行语义判别,构造“易混淆样本-正样本-负样本”三元组;同时,采用参数随机扰动机制为每个样本生成自身正例;最终在对比学习框架下实施簇间分布联合优化。在四个公开短文本数据集上的实验结果表明,与现有先进模型相比,所提方法的聚类效果均有提升,平均准确率提高了5.14%,平均标准互信息提升了2.51%。通过实验结果的分析,进一步验证了该方法不仅显著提升了模型对簇间易混淆样本的语义辨别能力,而且有效缓解了语义相似簇间的特征分布重叠问题。
来源:2025年第10期
《计算机应用研究》期刊编辑部