国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:李代伟,蒋欣然,向筱铭,于曦,周颖,张海清,
单位:1.成都信息工程大学软件工程学院,成都610225;2.智能公差设计与检测四川省工程研究中心,成都610225;3.四川省气象探测数据中心,成都610072;4.成都大学斯特灵学院,成都610106;
关键词:多场景对话生成,条件选择性数据增强,解码惩罚,响应多样性,长度控制,
基金:四川省科技计划资助项目(2024YFHZ0318);中国气象局“揭榜挂帅”科技项目(CMAJBGS202302);;
针对对话生成任务中高质量训练样本稀缺及生成响应存在冗余、长度失当的问题,提出一种融合条件变分自编码器数据增强与动态解码惩罚机制的联合优化方法。首先,在选择性数据增强框架中引入条件变分自编码器作为重建器,构建CSDA框架,显式建模查询-响应语义依赖关系,提升生成样本的语义一致性与多样性;其次,针对DialogBERT在解码阶段的高频词重复与长度控制不足,提出PenalBERT算法,引入重复惩罚与长度惩罚系数,在不改变模型结构的前提下优化解码过程。在DailyDialog、AnnMI和ESConv三个公开数据集上的实验表明,CSDA框架显著扩充了样本量(提升6.8%~99.8%),并优化了BLEU与Distinct指标;PenalBERT算法显著降低困惑度(最高9.01%),同步提升BLEU-4(最高3.69%)和NIST得分(最高3.32%)。联合优化方法能有效缓解数据稀疏问题,提升生成响应的准确性、多样性与流畅性。
来源:2026年第5期
《计算机应用研究》期刊编辑部