国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:孙林嘉,康美金,王莹琳,
单位:北京语言大学语言科学与资源学院,北京100083;
关键词:自动标注,声母韵母,汉语方言,连续语音,音类检测,模板匹配,
基金:中国语言资源保护工程专项项目(YB2005B004);中央高校基本科研业务费资助项目(23YJ170009);;
针对低数据条件下连续汉语语音的自动声韵母标注方法进行了研究。提出采集有限样本构建声韵母模板,采用模板匹配策略确定连续语音中声韵母的边界及转写。基于声韵母特性,系统性地引入音类检测技术,将连续语音分为清音、浊音及元音等音类区域,以此提升模板匹配的精度与效率。将融合音类检测和模板匹配的声韵母标注方法应用于普通话、晋方言和吴方言的语音数据集,系统开展性能分析与效果测试。实验结果表明,每个声韵母模板使用20~25个样本构建,所获标注结果的精确率、召回率及F1值分别达92.68%、93.05%和92.86%。即便在引入噪声的情况下,各项指标仍保持较高水平,分别达91.97%、92.51%、92.43%。与多项方法比较,准确率、召回率和F1值分别至少提升了4.46、4.29和4.37个百分点。证实所提方法在可控成本下能够取得鲁棒的标注结果。
来源:2026年第3期
《计算机应用研究》期刊编辑部