国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:王春东,竹文颖,林浩,
单位:1.天津理工大学计算机科学与工程学院,天津300384;2.计算机病毒防治技术国家工程实验室,天津300384;
关键词:深度神经网络,自然语言处理,中文对抗样本,多扰动策略,
基金:国家自然科学基金联合基金资助项目(U1536122);国家重点研发计划“科技助力经济2020”重点专项资助项目(SQ2020YFF0413781);天津市科委重大专项资助项目(15ZXDSGX00030);;
针对深度神经网络(DNN)在面对对抗样本的脆弱性问题,以及中文环境下高质量对抗样本的缺乏,提出一种新的中文对抗样本生成方法CMDS。在关键词选择阶段,该方法使用的Score函数结合了人类阅读时容易忽视和在意的地方,计算出适合添加扰动的位置,保证了对抗样本良好的阅读性,难以被识别。在对抗样本生成阶段中充分发挥中文特点,兼顾字形、字义以及带有地方特色的谐音等,使用相似字词、近义词、谐音和乱序的多种扰动策略,并采用多扰动优先级策略生成对抗样本,最后用扰动率阈值控制输出,剔除与原文差距过大的对抗样本。之后,与基线方法进行多种实验对比,探究扰动阈值大小的影响、人工评测以及真实场景攻击检验,证实了CMDS方法对于提升模型安全的有效性以及可迁移性。从实验结果来看,CMDS的攻击效果和生成对抗样本对于模型安全的提升能力均优于基线方法,攻击成功率最高多出36.9百分点,对于模型安全提升30百分点以上,生成的对抗样本质量高且有较强的泛化性。
来源:2025年第6期
《计算机应用研究》期刊编辑部