计算机应用研究

北大核心,JST,Pж(AJ),CSCD扩展版,WJCI

国内刊号:51-1196/TP

国际刊号:1001-3695

计算机应用研究杂志2025年第10期:基于大模型的污染规范提取方法

发布日期:

作者:方梦麒,徐建,

单位:南京理工大学计算机科学与工程学院,南京210094;

关键词:隐私泄露,污染规范,大模型,半监督学习,

随着移动应用的广泛普及,隐私泄露问题日益成为亟待解决的挑战。现有的隐私泄露分析技术通常依赖预定义的源和汇API(application programming interface)列表,即污染规范,而传统污染规范提取方法多采用手动筛选或机器学习算法,难以适应大规模应用场景,且误报率较高。针对上述问题,提出一种基于大模型的污染规范提取方法TaintLM。TaintLM以官方API文档为主要输入,并构造精心设计的指令驱动大模型进行多任务学习,实现源汇分类和语义分类;同时,针对当前领域数据不平衡问题,提出一种多任务迭代微调策略,将半监督学习引入多任务学习框架中,通过半监督学习生成伪标签数据并在微调过程中迭代优化模型性能。实验结果表明,TaintLM在源汇分类和语义分类任务上的F1分数分别为0.92和0.94,优于现有主流方法。该方法提升了污染规范提取的准确性,验证了其在污染规范提取中的有效性,为移动应用隐私保护提供了高效的技术支持。

来源:2025年第10期

《计算机应用研究》期刊编辑部

查看计算机应用研究杂志2025年第10期

联系我们

  • 地址:四川省成都市武候区成科西路3号
  • 电话:028-85249567
  • E-mail:journal@arocmag.cn

咨询工作人员