国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:徐贞顺,王振彪,郑顺国,苏梦瑶,张文豪,唐增金,
单位:北方民族大学a.计算机科学与工程学院;b.图像图形智能处理国家民委重点实验室,银川750021;
关键词:数据挖掘,监督学习,主题模型,引导词,自适应重构,
基金:宁夏自然科学基金资助项目(2021AAC03217);宁夏重点研发计划(重点)项目(2023BDE02001);银川市校企联合创新项目(2022XQZD009);;
主题模型通过对大量数据进行分析,挖掘数据中潜在的主题结构和语义关系,将数据按照主题进行分类和归纳,提高了信息处理效率。为解决现有的主题模型面临生成的主题语义相互崩溃、缺乏监督标签和引导词的指导等问题,提出了一种新的多维度损失函数下引导词协同sinkhorn的监督式主题模型。该模型设计了多维度损失函数,首先结合自适应重构损失、监督损失和条件变分自编码器损失等协同策略,同时引入正则化和标准化方法,避免了主题语义崩溃的问题。其次,该模型通过将引导词与sinkhorn算法相结合的损失函数,有效解决了聚焦主题的覆盖问题,使得模型在生成过程中更加专注于特定主题,同时增强了可解释性。实验结果表明,该模型有效地解决了主题崩溃和侧重性主题覆盖等问题,生成了多样化和连贯的主题以及高质量的文档主题分布,不断超越最先进的基线。
来源:2025年第9期
《计算机应用研究》期刊编辑部