计算机应用研究杂志2025年第8期
-
- 基于深度学习的手语翻译:过去、现状与未来
- 张磊,王振宇,连帅帅,蒲冰倩,刘毓涛,秦铭哲,
- 基于深度学习的手语翻译(SLT)旨在使用深度学习方法对手语动作进行翻译,以提高翻译准确性。SLT降低了正常人与听障人士的沟通门槛,但由于各国手语不统一以及手语动作与口语句子的结构不匹配等问题,手语翻译面临诸多挑战。随着深度学习技术的发展,基于深度学习的手语翻译被研究人员广泛关注。通过对近年来基于深度学习的手语翻译方法进行总结,并依照模型结构与发展历程将其分为基于线性结构的手语翻译、基于编码器-解码器的手语翻译、基于大模型微调的手语翻译和基于对比学习的手语翻译四类。通过对各类方法的特点与性能进行分析,并为手语翻译方法的进展提供了全面的评估。最后,展望了未来研究的方向,重点讨论了实时翻译、基于对比学习的手语翻译和基于大模型微调的手语翻译等关键技术的潜力和发展趋势。
-
- 融合知识图谱的大语言模型研究综述
- 曹荣荣,柳林,于艳东,王海龙,
- 大语言模型在多个垂直领域应用中展现出卓越性能,但其生成内容存在可解释性不足与幻觉问题,严重制约了实际部署。而知识图谱以结构化语义网络形式存储事实知识,为增强大语言模型的可控性与知识约束提供了新路径。为此,系统梳理知识图谱与大语言模型融合的技术路线,从预训练、模型架构改造、微调优化三个阶段分析代表性方法,总结其提升模型可解释性与缓解幻觉的作用机制,并探讨多模态知识表示对齐、动态知识更新滞后等核心挑战。分析表明,知识图谱的深度融合可显著提升大语言模型生成内容的事实一致性,但未来需突破多模态知识对齐、轻量化增量式融合及复杂推理验证等技术瓶颈,推动大语言模型向知识语言协同驱动范式演进,为构建可信、可解释的智能系统提供理论支撑与技术方向。
-
- 基于稳定扩散与自适应增强技术的服装模特图像生成方法
- 刘大伟,于碧辉,石珈维,魏靖烜,史慧洋,靳赫烜,孙林壮,
- 随着计算机视觉和生成模型的发展,图像生成技术取得了显著突破,已广泛应用在电子商务的产品展示中以增强用户交互体验。逼真服装模特生成是图像生成技术与电子商务业务深度融合的创新应用技术之一。然而,服装模特生成技术在电商应用中仍面临着诸多挑战,尤其在生成高质量、真实感的服装图像方面,难以精确呈现服装的事实一致性、纹理和细节,相比于真实图像的自然度和一致性较差。为了提升服装模特生成技术在电商应用中的效果,提出了一种改进的稳定扩散生成模型LoRA-DAE。通过低秩分解优化跨注意力层和卷积层的权重调整机制,并在生成过程的方向扩散步骤中添加自适应增强模块;采用细粒度的纹理增强策略,动态调整生成过程中的纹理与细节分布,解决了当前主流服装模特图像生成模型的纹理模糊和边缘失真等问题,提升了服装图像的细节表达能力和整体真实感。实验结果表明,LoRA-DAE在Fashion Mannequin数据集上取得了优于主流方法的性能表现,生成的模特图像在感知质量(用户评价)、定量指标(FID、IS、PSNR、SSIM值)和多模态大模型VQA评估上均具有显著提升。
-
- 生物启发的运动人群瓶颈效应感知视觉神经网络
- 陆显佩,胡滨,
- 在大型活动中,人群瓶颈效应是常导致拥挤甚至踩踏等灾难事件的重要前兆。然而目前针对人群瓶颈效应检测的计算模型研究工作较少,且由于这种效应随机性强、人群状态复杂多变,传统的计算模型检测效果并不理想。为解决这一问题,在借鉴蝗虫视觉系统神经结构特性的基础上,结合蝗虫LGMD危险感知机理,提出了一种运动人群瓶颈效应感知视觉神经网络(CBEPVNN)。该模型模拟蝗虫和哺乳动物视觉信息处理特点,整合视野域中人群活动所引发的视觉运动信息,利用LGMD神经元危险感知机理构建尖峰阈值机制调谐神经网络输出,以感知视觉场景中的运动人群瓶颈效应。实验结果表明,CBEPVNN能够有效感知视频序列中的运动人群瓶颈效应,并产生强烈的偏好性响应。该工作涉及生物视神经机理启发的人群动态视觉信息处理机制,可为智能视频监控中的异常人群活动检测与行为分析提供新的思路与方法。
-
- 基于情感引导-扩散模型的藏族音乐生成网络
- 宋子牛,彭春燕,王龙辉,郑钰辉,
- 人工智能技术在音乐创作领域取得了显著进展,但针对藏族音乐自动生成的研究相对匮乏。现有研究在藏族音乐生成中主要面临三个挑战:缺乏特定情感的表达能力、高维特征处理效率低下,以及音乐上下文一致性不足。为解决上述问题,提出一种基于情感引导的扩散模型(emotion-driven diffusion model,EDDM)。该模型基于VAE-diffusion框架,利用变分自编码器提取音源数据关键潜在特征,并在扩散过程中对其进行建模。首先,设计情感特征编码器以提取音乐情感特征,并通过交叉注意力机制将情感特征嵌入到扩散模型中,实现藏族音乐特定情感和风格的精准表达;其次,引入token drop策略过滤冗余特征,提高音乐生成的鲁棒性和多样化;最后,提出self-conditioning机制增强上下文关联,利用上一步信息来指导下一步结果生成,确保音乐生成的一致性。实验结果表明,EDDM在藏族音乐生成任务上效果突出,在客观评价方面,模型在FAD(2.35↓)、JSD(0.08↓)、NDB(18↑)等指标上均优于现有方法;主观评价中,生成的音乐展现出良好的情感表达能力和音乐特征一致性。EDDM在民族音乐自动生成领域具有一定的创新性和应用价值。所生成的部分情感引导的藏族音乐公开在https://szn1998.github.io/。
-
- 增强现实机器人的虚实同步手势交互方法
- 王振宇,许驰,李琳,洪悦,
- 针对增强现实场景下,动态人机交互的感知能力差、同步精度低、执行效率低等问题,建立了增强现实机器人虚实同步交互架构,提出了虚实同步手势交互方法。首先,提出手势识别与虚实坐标映射方法,利用姿态解析与正/逆运动学矩阵将手势姿态映射到机器人关节,完成虚实同步的双向控制,提升系统的可操作性与感知能力;然后,提出了一种基于位置矢量的低通滤波算法,降低虚实交互的噪声影响,提升人机交互的顺畅性;最后,搭建了机器人虚实交互的原型系统并进行了实验验证。实验结果表明,系统在路径调整与姿态跟踪中,最大误差控制在±0.01 m以内,验证了系统在机器人虚实同步上的适用性与高精度性。
-
- 隐式情绪导向的语音驱动仿生机器人说话方法
- 徐康,袁野,付军秀,傅柯婷,任钦泽,刘娜,
- 提出了一种创新的隐式情绪导向语音驱动方法,用于仿生机器人的面部表情与头部姿态生成。该方法基于深度学习,通过引入颈部舵机控制系数,突破了传统方法仅依赖预编程随机动作序列的局限,实现了音频信号到自然表情的精确映射。此外,提出了一种隐式情绪导向特征融合自编码器框架,无须显式输入情绪参数,即可从音频中隐含地推断情绪特征,并生成丰富的面部表情和颈部运动。实验表明,该方法在多个数据集上显著优于现有技术,并且通过轻量化设计,能够高效适应资源有限的移动设备。
-
- 对比学习增强的多行为超图神经网络推荐模型
- 王光,李佳欣,
- 多行为推荐(multi-behavior recommendation,MBR)在互联网平台中愈发重要,但现有方法仍面临两大挑战:a)无法刻画用户不同行为下的复杂兴趣偏好;b)难以建模不同行为间的相互关系。基于此,提出一种对比学习增强的多行为超图神经网络模型(multi-behavior hypergraph neural network model enhanced with contrastive lear-ning,MBHCL),在建模用户复杂多类型交互的同时,结合对比学习捕获行为间共性与差异,以获取更优嵌入表示,缓解冷启动与数据稀疏问题。具体地,MBHCL首先构建用户-项目多行为交互超图,以刻画用户对项目不同维度的偏好;其次设计三个对比任务整合单行为表示,通过捕捉行为间的共性与差异获取全面用户兴趣偏好。最终,MBHCL在四个真实场景数据集上进行对比实验。结果表明,在Tmall和BeiBei数据集上,HIT和NDCG指标有至少4.8%的提升,在Kuairand和Yelp数据集上,HIT和NDCG指标至少提升3.6%,并通过消融实验验证了各模块的有效性,同时显著改善了冷启动用户推荐效果。
-
- 基于时间块动态图神经网络的序列推荐方法
- 彭梓航,张全贵,金海波,刘怡欣,齐玉欣,
- 基于动态图的序列推荐是当前推荐系统领域的一个研究热点。现有方法通常基于用户-物品交互序列的每个时间戳构建动态图,基于精细时间分辨率的方法,很难解决序列中用户偶然行为引发的噪声问题,同时也难以有效捕捉用户的周期性偏好。为此,提出了一种基于时间块动态图神经网络的序列推荐方法TBDGNN(time-block-based dynamic graph neural network)。该方法首先根据用户-物品交互历史数据分布,将时间序列划分为若干个时间块。然后在每个时间块内构建动态图,以建模用户行为的时间演化。接下来,设计了一个时间块级的图神经网络框架,通过时间块划分来减少用户误操作等偶然交互的影响,并捕捉用户的周期性行为。实验表明,TBDGNN在MovieLens等数据集核心指标上显著优于DGEL基准,其中hit@10最高提升8.7%。实验结果验证了模型在动态推荐与周期性行为建模中的有效性。
-
- 基于跨图特征融合和结构感知注意力的图相似度计算
- 庞俊,闫炳鑫,林晓丽,王蒙湘,
- 图编辑距离(GED)是一种常用的图相似性度量函数,其精确计算为NP-hard问题。因此,近期研究者们提出诸多基于图神经网络的图相似度计算方法。现有方法在特征提取时忽略了两个图节点之间的跨图交互信息,并且缺乏对图中节点高阶关系的学习。针对以上问题,提出了一种基于跨图特征融合和结构感知注意力的图相似度计算模型(cross-graph feature fusion with structure-aware attention for graph similarity computation,CFSA)。首先,该模型提出了一种跨图节点特征学习方法,引入跨图注意力机制提取节点的跨图交互信息,并将节点的局部特征和跨图交互特征进行有效融合;其次,提出了一种结构感知型多头注意力机制,结合节点特征信息和图结构信息,有效捕捉节点间的高阶关系。在三个公共数据集上的实验结果表明,CFSA模型的预测准确率相较于现有模型分别提升4.8%、5.1%、15.8%,且在大多项性能指标上均有优势,证明了CFSA在GED预测任务上的有效性和效率。
-
- 基于水波传播特性的半监督密度聚类算法
- 冯彦超,王杰,栗雅婷,蔡江辉,杨海峰,
- 半监督密度聚类通过融合监督信息与密度特征优化聚类性能,但在数据分布不均时,传统半监督密度聚类算法常因全局密度阈值设定与约束信息利用不足,难以捕捉局部密度差异,导致稀疏区域簇识别能力受限。针对这一挑战,提出了一种基于水波传播特性的半监督密度聚类算法(SDR)。受水波“波心恒定”和“振幅衰减”特性的启发,SDR模拟簇心稳定性及密度从中心向边界递减的趋势,通过局部密度差异识别初始子簇。进一步利用邻居影响力分配剩余点,并结合标签附着度动态合并子簇。在5个合成数据集和7个真实数据集上的实验结果证实了SDR算法在稀疏区域聚类任务中的有效性。
-
- 基于多分辨率模块度的约束Louvain社区检测算法
- 张震,靳金帅,陈可鑫,田鸿朋,
- 针对Louvain算法的分辨率存在极限的问题,提出一种基于多分辨率模块度(multi-resolution modularity,MRQ)的Louvain社区检测算法,在Louvain算法中加入一个可变分辨率模块MRQ,有效解决了Louvain算法分辨率存在极限的问题。在此基础上,针对Louvain算法会得出某些不满足社区条件的划分结果,增加社区划分的约束条件,提高了社区划分的精度。最后,在真实数据集和计算机生成网络上对该算法进行实验验证。实验结果表明,具有MRQ的约束Louvain算法在模块度、覆盖度和调制度指标上都优于Louvain、标签传播(LPA)、Kernighan-Lin(KL)和贪心模块度等主流社区检测算法。
-
- 基于脉冲神经元膜电位增量的数据分布统计量及批归一化
- 李炜奇,陈云华,陈平华,朱春佳,
- 脉冲神经网络(SNN)因其具有更好的生物解释性、强大的时空信息表征能力,以及超低功耗和延迟特性而受到广泛关注。然而SNN在训练算法、超参数设置、架构设计研究等方面还存在不少挑战性的问题。针对现有SNN归一化(BN)方法无法有效处理时间依赖性的问题,通过分析膜电位增量在时间步上的传播,提出按时间步逐步计算膜电位增量的时空积累量;以此为数据分布的统计量分别对各个时间步数据进行归一化,并提出按照指数移动平均计算膜电位增量的时空积累量,形成一种带衰减因子的时空累积批归一化(spatio-temporal attenuation cumulative batch normalization,STBN)方法。在CIFAR-10 和 CIFAR-100及CIFAR10-DVS数据集上的实验结果表明,所提方法能显著提升网络分类精度并降低时延。特别是在CIFAR-100数据集上仅使用两个时间步就获得了76.30%的精度,相比同类模型的先前最优算法精度提升了3.43%。
-
- 基于边更新与多头交互融合Transformer的车辆轨迹预测方法
- 孙颖,吴延勇,丁德锐,张建坤,
- 自动驾驶领域下的智能体轨迹预测任务需要充分考虑到智能体与交通环境之间的关系。为了解决现有方法在异构特征交互层面的局限,提高预测精度,提出一种基于边更新与多头注意力交互融合Transformer的车辆轨迹预测方法EMATNet(edge-updating multi-head attention Transformer network)。该方法首先编码嵌入智能体与交通环境信息的历史时空信息;接着通过所提出的边更新与多头注意力交互融合Transformer两阶段式交互网络,引入对称位姿嵌入与车路关系交互,有效增强全局信息感知与时空关系捕捉能力;最终采用两阶段式优化解码确保预测结果的准确性与合理性。在Argoverse 1和Argoverse 2两个运动预测数据集验证模型有效性,并可视化分析预测结果。结果表明,EMATNet在minFDE、minADE、MR指标上均优于同类方法,能够胜任复杂交通环境车辆轨迹预测任务。
-
- 基于地图分解AGV全局路径规划新方法
- 汪行,黄细霞,梁董,
- 针对传统A*算法在大型场景下AGV(automated guided vehicle)路径规划时遍历节点多、路径平滑性差和搜索时间长等问题,提出了三层结构的块搜索A*(Blocks-A*)算法,并构建麦克纳姆轮AGV解决运动学约束问题。Blocks-A*算法将地图分解为多个较大的区域(块),采用以块搜索代替节点搜索的方式。第一层,通过先验地图信息划分自由空间和限制空间,将自由空间分解成若干三角形,对三角形进行节点等效化并构建邻接矩阵;第二层,运用Blocks-A*算法计算最优块通道,生成基于邻接三角形边界线中点的次优路径;第三层,根据不同场景应用线性规划或二次规划优化模型,生成最终的最优路径。实验结果表明,所提算法在大型场景下的遍历节点数明显减少,优化后的路径平滑度更符合AGV的运行要求,搜索效率得到显著提高,可专门应对大型场景下的路径规划问题。
-
- 考虑交通拥堵的冷链配送路径动态优化
- 曹菁菁,魏杰,雷阿会,韩鹏,冯子立,王梦简,
- 针对交通流的不确定性和难预知性导致的交通拥堵,从而影响冷链配送效率的问题,提出考虑交通拥堵的带时间窗的冷链车辆路径问题,建立了0-1整数规划模型;然后,利用变交叉操作和自适应扰动因子对免疫遗传算法(IGA)进行改进,提出基于变交叉下降的免疫遗传算法(VCD-IGA);最后,利用某生鲜企业配送过程中的实际配送数据和交通流数据进行实验。实验通过自主搭建的信息系统进行数据交互,并通过VCD-IGA对配送路径进行实时动态优化。实验表明,相较于静态决策,提出的动态决策使得配送总成本降低29.6%,平均物流服务水平提升18%。
-
- 基于域内和域间元路径聚合的跨域推荐方法
- 许嘉,王歆,王艳秋,吴海威,吕品,
- 跨域推荐技术通过深入挖掘及利用其他域的有用信息,有效提升目标域的推荐表现,为解决用户冷启动问题提供了一种有效途径。然而,当前跨域推荐方法存在局限,未能细粒度地扩展隐式关系,并且忽视了嵌入向量中可能包含的冗余信息,从而制约了跨域推荐系统的性能。鉴于此,提出一种基于域内和域间元路径聚合的跨域推荐方法,IMCDR(intra-domain and inter-domain meta-paths aggregation based cross-domain recommendation)。IMCDR首先通过细粒度地计算实体多字段的语义嵌入,有效扩展用户-用户和物品-物品关系;然后,IMCDR基于域内元路径和域间元路径为每个节点分别生成私有特征和共享特征,并将它们有效融合,以获得更高质量的嵌入向量。在三个跨域推荐任务上的综合实验结果表明,IMCDR在有效性和性能上具有明显优势。
-
- 基于辅助行为去噪的多行为推荐
- 陈文浩,陈媛,朱小飞,
- 多行为推荐(MBR)系统通过辅助行为分析用户偏好,以缓解数据稀疏性并提高推荐准确性。然而,先前工作使用随机初始化的用户和物品嵌入,无法提供良好的信息价值,也未考虑到在行为嵌入聚合中存在的噪音,以及辅助行为交互序列中的噪声。为了解决这些问题,提出了一种基于辅助行为去噪的多行为推荐模型(ABD-MBR)。首先,使用预训练的方式来获取用户和物品初始嵌入。然后,设计投影聚合模块将辅助行为投影到目标行为空间上进行聚合来减少嵌入聚合时噪声的影响,并设计bot-k和top-k采样模块对辅助行为的交互序列进行优化来减少交互序列噪声的影响。最后,采用多任务学习对模型进行优化。在三个公开数据集上的实验表明,与 MB-HGCN 相比,该模型在 HR@10 上平均提高了10.2%,在 NDCG@10 上平均提高了13.4%,验证了模型的有效性。
-
- 一种图文协同层级融合的多模态命名实体识别方法
- 冯广,刘天翔,杨燕茹,郑润庭,钟婷,林健忠,黄荣灿,
- 多模态命名实体识别(MNER)旨在结合文本和图像等信息,提高命名实体识别的准确性。然而,现有方法因文本表达不规范以及图像特征提取聚焦于局部信息,导致图文语义特征利用不充分。针对该问题,提出了一种图文协同层级融合(VTCHF)的命名实体识别模型,不仅利用全局视觉特征来补充视觉语义,还通过协同自变分编码器充分利用图像与文本特征,协同生成包含视觉语境信息的特征,从而增补文本语义。随后,设计了层级融合模块,预融合图文特征及其语义特征,自适应增强图文语义粒度,缓解后续模态融合中的对齐偏差。在多个公开数据集上的实验结果表明,该模型显著提升了命名实体识别的准确率、召回率和F1值,验证了其优越的性能。
-
- 融合正交学习和动态平衡的麻雀搜索算法及应用
- 何洪玉,潘家文,钱谦,
- 针对麻雀搜索算法收敛速度慢和搜索能力不平衡的缺点,提出一种融合正交学习和动态平衡的麻雀搜索算法(SSAOD)。首先引入正交学习策略来加强个体间信息传递,提高算法的收敛速度;然后采用动态平衡策略,增强算法在迭代前期的全局探索能力和迭代后期的局部开发能力,从而平衡两种搜索行为。SSAOD在IEEE CEC 2022测试函数上整体寻优能力第一,稳定性更好,收敛速度更快更精确;在多阈值图像分割问题上获取到的图像细节更清晰,信息更丰富。实验结果证明所提算法不仅有更好的数值优化能力,还有较好的解决实际问题的能力。
-
- 融合盈亏拿取策略的改进遗传算法求解TTP
- 江晓菊,谭代伦,冯世强,
- 旅行小偷问题(TTP)是由旅行商问题(TSP)和背包问题(KP)复合而成的一类新型组合优化问题,其优化模型涵盖了两类问题的约束条件,也继承了两类问题的计算难度。针对TTP,提出了一种融合盈亏拿取策略的改进遗传算法。对任意旅行商回路上的物品列表,定义了超值物品并采取必拿策略,对剩余物品定义了亏本物品并予以剔除,对剔除后的剩余物品引入了双评分计算公式,并按混合排序策略进行综合排序,再依序选入背包,整个处理过程构成盈亏拿取策略。对于遗传算法,设计近邻域搜索和截断交换的种群初始化策略以提升初始种群的质量;采用随机遍历抽样选择算子、部分匹配的交叉算子、二次变异算子以强化优胜劣汰和维护种群的多样性;增加重插入算子以保持种群稳定。仿真实验表明,改进策略明显提升了算法性能,对算例的求解结果达到预期,改进算法具有良好的寻优能力和稳定性。
-
- 基于引力势能修正的快速行进树路径规划算法
- 徐正宇,贾小林,顾娅军,袁雷,
- 针对快速行进树算法(fast marching tree,FMT*)在移动机器人路径规划中存在冗余探索多、路径规划时间长、路径拐点多等问题,提出了一种基于引力势能修正的快速行进树算法(gravitational potential energy FMT*,GPE-FMT*)。该算法借鉴人工势场法的思想,通过引入有限的引力势能场限制路径探索范围,从而有效减少冗余搜索;同时,采用基于引力势能值的路径树修正策略,在路径树扩展过程中对其生长方向进行引导,使路径树的生长方向更靠近终点,从而减少路径中的拐点,缩短规划时间。仿真实验结果表明,在相同计算资源下,GPE-FMT*显著减少了路径规划时间,降低了路径拐点数和算法迭代次数,提升了路径质量。
-
- 多突触连接脉冲神经元的突触延迟在线监督学习算法
- 王向文,邹丽,范景行,
- 神经科学研究表明,突触延迟在神经信息处理过程中扮演着积极角色,且多突触连接广泛分布于神经系统中。然而,当前脉冲神经网络建模时大多采用单突触连接模式,且在监督学习算法的设计中未充分考虑突触延迟的影响,限制了其潜在性能。鉴于此,构建了一个具有多突触连接的脉冲神经元网络,并提出了一种具有生物可解释性的在线监督学习算法,能够同时优化脉冲神经元的突触权值与突触延迟。该算法应用脉冲序列的核函数表示构造实时误差函数,并应用梯度下降方法推导突触权值和突触延迟的实时更新规则。脉冲序列学习和非线性模式分类任务的结果表明,动态突触延迟学习算法比静态突触延迟学习算法的学习准确率更高且所需的学习周期更少,并且多突触连接比单突触连接的学习准确率更高。可见,突触延迟可塑性以及多突触连接模式可以有效提升脉冲神经网络的学习性能。
-
- DRO框架下不平衡分类损失函数重加权优化
- 李佳静,林耿,
- 在不平衡数据的多分类任务中,由于类别分布存在数量差异,分类器的决策边界往往偏向多数类别,从而导致模型难以实现准确分类。现有研究主要关注于数据平衡策略和损失函数的结构调整,忽视了样本标签可能存在标注错误或噪声,标签信息的不确定性会进一步增加分类的难度。为解决这一问题,提出了一种名为加权标签分布稳健(weighted label distributionally robust Kullback-Leibler,WLDR-KL)的损失函数。该损失利用先验信息和标签权重显式地调整模型对少数类别的关注度,通过优化最不利的集合下的预测分布来应对数据标签不确定性下的不平衡分类任务。此外,利用 Monte Carlo模拟提出了一种不平衡数据集的仿真方法,以更全面地评估各损失函数在不同类别和不同数量差异水平下的表现。在多组模拟数据集、UCI和 Kaggle数据集上的实验结果表明,所提出的方法在处理不平衡数据时表现良好,并且在top-k准确率、F1值、精度、召回率上均实现了一定程度的提升,为解决不平衡分类问题提供了一种有效的方法。
-
- 基于污点分析的移动端深度学习模型泄露自动分析方法
- 朱文天,林璟锵,
- 现有的移动端深度学习模型泄露分析方法依赖于移动端应用动态运行和人工触发深度学习功能,具有不稳定性且需要大量人工参与,限制了分析方法的使用范围。为了更加自动化地分析更多深度学习模型,提出了一种基于污点分析的移动端深度学习模型泄露自动分析方法。该方法综合使用关键字匹配和熵值判定技术提取移动端应用中的模型文件,并使用基于模拟执行的污点分析方法追踪模型解密的函数地址,最后调用解密函数得到模型明文。基于设计方案,实现了自动分析工具ModelDec,在主流应用商店上的实验分析结果显示,该方法的模型泄露检测率和分析时间均优于现有公开方法,充分展示了该方法的有效性。
-
- 基于GPU的Winograd卷积算法并行化
- 王鑫,甄雪茹,
- 针对现代卷积神经网络中计算负荷过重的问题,提出一种基于GPU的创新性Winograd并行卷积算法。该算法利用负载均衡的任务映射、优化数据加载策略以隐藏延迟,并结合动态填充方法,充分挖掘Winograd卷积算法与GPU架构的协同效应。实验结果表明,在经典卷积神经网络模型ResNet的多个卷积层上,提出的算法优于NVIDIA cuDNN 8.3.0库中的标准Winograd卷积算法,在Turing架构的RTX 2080Ti GPU上实现高达2.46的加速比,并且保持较高的计算准确性。与基于GPU的标准Winograd卷积算法相比,该算法显著提升了卷积计算效率。
-
- 基于强化学习的灾区应急无人机网络服务公平性最大化方案
- 李槐城,彭舰,黄文,沈群力,廖思睿,
- 现有研究无人机灾区应急通信服务的方法在全局环境信息下优化网络性能,存在组网效率低和资源分配不均衡的问题,在灾区环境下难以维持平衡的通信服务,导致部分用户无法被及时救援。针对上述不足,提出并解决了无人机通信质量最大化问题:将问题建模为部分观测马尔可夫决策过程(partially observable Markov decision process,POMDP),设计基于深度强化学习的路径规划和资源分配方法,建立以网络吞吐量为服务质量指标,Jain’s公平性指数为均衡性准则的评估体系。设计基于目标解耦的奖励函数机制,构建参数化深度图强化学习网络,实现无人机轨迹规划与资源分配的联合优化。在16种不同条件的仿真环境下进行对比实验,该方法的性能优于其他四种方法,在公平性指标上较现有方法提升9.6%,并在不同指标上均验证了方法的有效性。
-
- 基于动态时间窗格的数据仓库流批一体优化方法
- 陈滨林,唐小勇,
- 数据仓库是企业数据管理核心,批处理和流处理是大数据分析的两种核心数据处理范式。为了解决传统批处理技术产出时延和资源消耗高的问题,以及流处理技术在处理多流数据关联和历史数据计算时面临的数据质量挑战,提出了一种流批一体处理方法。所提方法通过分析数据集在不同时间窗格中的变化,融合了基于调度时间的动态时间窗格划分和基于DFS算法的最简数据集搜索。实验结果表明,与主流微批处理方法相比,该方法将整体计算时间缩短57.2%,内存消耗减少24.2%,同时确保了数据的强一致性。该方法对于企业构建高处理效率、低资源消耗的流批一体化数据仓库具有重要参考价值。
-
- 基于联邦对比学习的航天器故障诊断
- 杨夏洁,林子谦,徐丹丹,尤艳丽,樊重俊,
- 航天器故障诊断通常通过判读遥测参数实现,然而,遥测到的时间序列数据由航天器各个关键设备采集,呈非独立同分布(non-independent identically distribution,Non-IID),传统的联邦学习方法在面对此类数据时,会因为局部模型更新导致模型偏移。针对上述问题,提出联邦优化算法——联邦对比时序诊断FclTAD,主要通过分析航天器Non-IID时序数据,判断某时刻航天器是否存在异常,能及时进行干预。首先建立了联邦对比时序诊断算法,算法分为局部更新和全局聚合两阶段,局部更新利用自编码器,有效捕捉时间序列中的长期依赖和非线性关系,引入联合对比正则化损失,增强模型故障诊断的判别能力;其次考虑传感器之间的差异,全局聚合阶段,通过规范化和加权聚合策略,适当修正不一致的局部更新,减少错误更新对全局模型的负面影响。最后,利用NASA公开数据集MSL和SMAP以及机器预测服务器数据集(PSM)进行仿真实验。实验结果表明,所提出的方法与其他方法相比,在航天器Non-IID时序数据故障诊断精确度可提高约14.37%,调整后F1值提高约7.82%,在保护航天器数据隐私的同时,既考虑了“客户漂移”问题,又较好地利用了局部和全局模型的内在关系。
-
- 车联网空地协同MEC系统的通算资源在线分配优化
- 付珍,李智灏,郑涛,骆博雅,崔苗,张广驰,
- 使用灵活性机动性俱佳的无人机与地面基站组成空地协同移动边缘计算(MEC)系统,能有效保障具有高移动性用户的车联网的MEC服务质量。为了适应车联网用户位置的实时随机变化特性,研究在线式的空地协同MEC系统的通信与计算资源分配优化,研究将无人机的飞行时间等分为多个时隙。在每个当前时隙,使用基于卡尔曼滤波的方法预测下一个时隙的车辆用户的位置。接着,根据当前时隙的资源分配情况,研究一个联合优化系统的通信带宽、计算任务卸载比例、无人机轨迹和计算资源的问题,最小化车辆用户的在下一个时隙的通信计算时延。为高效求解该非凸优化难题,提出一种高效交替优化算法,将原问题分解为带宽分配子问题、计算任务卸载比例分配子问题、无人机轨迹优化子问题和计算资源分配子问题,并对这些子问题进行交替迭代求解。仿真结果验证了所提在线优化算法具有良好的实时性表现,能够明显降低车辆任务所需的通信计算时延,显示了实时优化通信与计算资源在车联网中的重要性和可行性。
-
- 基于二跳邻居的分布式大规模混合多智能体系统一致性协议
- 谢光强,冯衍达,李杨,
- 分布式多智能体系统(MAS)一致性是实现协调控制的首要条件。多智能体一致性协议通常使用一跳邻域信息进行收敛,每个智能体仅通过有限的局部信息导致收敛速度缓慢。为解决上述问题提出了一种基于二跳邻居的分布式一致性协议。首先,提出方法综合一跳和二跳的邻域信息作为计算智能体的下一状态的基础,增强了智能体的决策能力;其次,提出了一种关键邻居选择方法,解决了收集二跳邻域信息可能导致的对计算效率和鲁棒性的影响;然后,设计了基于相对最近邻拓扑的约束集构造方法以增大约束集的范围。最后,通过引入凸包和实例分析,证明了该协议的连通性和收敛性,同时对多种类型的拓扑进行了大量的仿真实验。实验结果表明,该协议在各种拓扑下都具有优势,特别是在大规模高密度拓扑上。
-
- 基于多智能体深度强化学习的海上风电传感器节点能效优化
- 贾林朋,王霄,何志琴,吴钦木,尹曜华,
- 海上风电场的高效运行依赖于无线传感器网络提供的监测数据。通过对现有研究中传感器节点部署与通信进行调查,指出了当前海上风电场景下无线传感器节点部署通信时能效优化研究不充分的问题。针对海上风电机组无线传感器网络的能效优化问题,设计了一种基于多智能体深度确定性策略梯度算法的优化方案。考虑了节点能量有限和特定的海上通信环境特点,通过多智能体协同优化节点的感知与通信策略,有效减少能耗并提升网络覆盖率和数据传输效率。结合自适应噪声策略、优先经验回放机制以及合理的奖励函数设计,进一步提高了算法的学习效率与能效表现。实验结果表明,所提算法相比DDPG基准算法提升了约26%的节点能效,训练速度较DDQN、SAC算法加快了33%和48%。
-
- 一种融合数据新鲜度的联邦学习动态激励机制
- 达吾列·金恩斯别克,王轶,周喜,王晓博,
- 在多轮联邦学习中,训练环境不断变化,基于多智能体强化学习(MARL)的激励机制通过自适应动态调整数据贡献策略,能够更好地适应动态环境。然而,现有基于MARL的激励机制在贡献评估时主要关注数据量,忽视了数据新鲜度,导致贡献评估不全面,限制了整体收益和模型性能。针对这一问题,提出了一种融合数据新鲜度的联邦学习动态激励机制。首先,提出了数据新鲜度度量及收益评估方法,以更全面地衡量数据贡献;其次,采用集中式训练与分布式执行的MARL框架,有效避免了参与方协调性不足的问题,以此最大化整体收益。实验结果表明,在五个不同规模的公开数据集上,所提方法整体收益提升约11.1%~25.0%。对比实验和消融实验结果进一步验证了该方法在不同数据质量条件下评估的公平性和有效性。
-
- 智能物联网中高效安全的自适应量化联邦学习
- 马海英,沈金宇,杨天玲,仇健,王占君,
- 针对现有自适应量化联邦学习存在参与者本地模型参数隐私泄露的问题,提出一种适合智能物联网的高效安全的自适应量化联邦学习方案。该方案利用自适应量化技术减少参与者的通信开销,设置两个聚合服务器,将Diffie-Hellman密钥交换协议、秘密共享方案和不经意传输协议相结合,构造一种保护本地模型参数隐私的安全聚合协议,并在合理假设下证明所提方案的安全性。实验结果表明该方案能够获得较高准确率的全局模型,极大减少了参与者的通信开销和隐私保护计算开销,非常适用于智能物联网中资源受限的轻量级物联网设备。
-
- 基于随机映射的隐私保护聚类算法
- 何丽丽,张成林,曹明增,张磊,
- 针对聚类隐私保护算法中隐私开销随数据维度增加而提升的问题,提出了一种基于随机映射的隐私保护算法(RPPP)。该算法首先利用对称不确定性方法筛选相关特征,并通过独立同分布的高斯序列生成随机矩阵。为增强距离保持特性,随机矩阵经Gram-Schmidt正交化处理确保正交性,随后分解成多个独立子矩阵,对降维特征进行映射,生成特征匹配域和加噪干扰域。为进一步增强隐私保护性能,在干扰域中注入随机噪声。实验分析表明,RPPP在隐私攻击防御方面具有较强能力。通过Cancer和Diabetes数据集实验验证,结果显示RPPP在隐私保护性和聚类效率上均优于传统算法,与UPA、GCCG和AKA相比,聚类效率分别提升约16.34%、23.44%和32.94%。综合来看,RPPP算法在提升隐私保护性的同时显著提高了聚类效率,验证了其有效性。
-
- 面向稠密区域的本地化差分隐私自适应空间分解
- 季博,李晓会,贾旭,
- 针对常规均匀网格法和自适应网格分解法处理空间数据时存在查询精度与查询效率较低的问题,提出一种基于本地化差分隐私的自适应空间分解算法(LDP-ASDT)。通过分组策略对空间进行分层分解,划分出稠密与稀疏区域;利用四分树通过设定合适阈值,对稠密区域进一步自适应分解;利用一元编码对划分结果进行扰动实现隐私保护。理论分析证明该算法满足本地化差分隐私。在三个真实数据集上进行实验,结果表明,查询精度与运行效率优于GT-R、PrivAG、KDRQ、ASDQT算法,在稠密区域查询精度比ASDQT算法提升一倍,运行速率提升17%。
-
- 残差混合注意力与自适应特征融合的脑肿瘤分割
- 吴进旭,吴云,
- 脑肿瘤图像的自动化分割在脑肿瘤的辅助诊断和治疗方面至关重要。针对脑肿瘤图像病变区域复杂多变、病灶与背景区域边界模糊的问题,提出了一种结合残差混合注意力、自适应特征融合的脑肿瘤分割方法(residual adaptive convolution-Net,RAC-Net)。首先,使用双动态卷积增强(dual dynamic convolution enhancement,DDCE)模块以实现更灵活的特征提取和增强模型的适应能力;然后,引入残差混合注意力(residual mixed attention,RMA)模块,以充分提取图像的全局与局部特征;最后,在解码路径中使用自适应特征融合(adaptive feature fusion module,AF2M)模块来对深层与浅层特征进行融合,以获取更丰富的特征信息。在公共数据集BraTS2019与BraTS2021上进行实验,并使用数据集BraTS2023进行跨数据集验证,结果显示RAC-Net的大部分指标均优于现有主流分割方法,说明该分割方法对临床相关脑肿瘤疾病的辅助诊断具有一定的应用价值。
-
- 融合时空信息与运动信息的骨架行为识别
- 魏维,郑程,唐櫞,李晨,
- 针对现有骨骼行为识别方法对时空依赖特征和运动信息利用不足的问题,在PoseConv3D的基础上提出了一种结合运动特征与时空注意力的改进模型。首先,采用四肢、头部以及躯干构成的肢体热图作为输入,以先验地增强邻近关键点的空间关联性;其次,通过引入时空、通道和运动激励模块来增强主干网络对关键时空特征的利用。最后,采用标签平滑损失函数代替交叉熵损失函数使模型取得更好的泛化能力。该模型在NTU RGB+D数据集上的识别精度分别为94.4%(X-Sub)和97.5%(X-View),在NTU RGB+D 120数据集上的识别精度分别为90.5%(X-Sub)和91.4%(X-View)。实验证明在基于骨骼热图作为输入的情况下结合运动特征与时空注意力,有效提升了行为识别的准确性。
-
- 基于双重扩散模型的图像恢复模型
- 李鹏,惠健,朱佩佩,
- 由于扩散模型对数据分布建模的卓越能力,基于扩散模型的图像恢复方法表现出色并获得了广泛关注。针对当前基于扩散模型的图像恢复方法中存在的噪声随机扰动以及数据一致性等问题,提出了一种图像恢复模型rddIRM,在传统的噪声扩散的基础上加入残差扩散,实现双重扩散效果。噪声扩散对待恢复图像的全局分布进行建模和学习,保留图像中的高频信息和细节;残差扩散表示从目标图像退化到输入图像的定向扩散,确定待恢复图像的整体结构和恢复方向。此外,提出将反向过程与数据一致性步骤解耦以及动态自适应调整扩散强度有效地提高了模型的计算效率和图像恢复效果。通过实验证明,rddIRM在各个图像恢复任务中都取得了相对优异的结果。
-
- 基于预训练扩散模型的两阶段高分辨率图像复原方法
- 谢源远,周非,周志远,张宇曈,
- 预训练扩散先验图像复原依赖预训练的扩散模型,无须微调即可处理各种经典图像复原任务。然而,目前的预训练扩散先验图像复原方法在处理高分辨率图像时效率低下,并且存在分布外问题(out of distribution,OOD)。针对以上问题,提出了一种基于预训练扩散模型的两阶段高分辨率图像复原方法,命名为由粗到细(coarse-to-fine,C2F)的方法。首先在预训练模型固定尺寸的coarse阶段得到粗糙的复原结果以保证输出一致性。然后在原尺寸的fine阶段上以coarse阶段结果为起点,使用更短的扩散过程来大幅度提升复原速度与获取一致性结果。在人脸与自然环境等多种场景下,以修复、上色、去模糊三种经典复原任务为目标,两阶段方法在任何尺寸下皆可获得最高水平的输出结果。对于1 024尺寸的图像复原,采样次数需求仅需要同类方法的22%,速度达到了同类方法的4.5倍,避免了OOD问题,并且在PSNR与FID指标上达到最高水平。实验表明,所提方法对高分辨率图像的复原速度远高于其他方法,并且避免了OOD问题,具有良好的复原效果。
-
- 基于自学习区域选择与边缘聚焦的单目3D检测
- 王鑫威,张友兵,周奎,
- 提出了一种基于自学习区域选择与边缘聚焦的单目3D检测算法。不同于以往直接使用整个RoI进行3D属性学习,所提算法通过数据驱动的模型自学习机制选择有价值区域,抑制无关区域的负面影响。同时,针对边缘截断目标,所提算法通过建模截断目标分布特点进行边缘增强,提升对截断高频区域聚焦。此外,引入了一种结合空间一致性约束的数据增强方法,通过在cut-and-paste中加入空间约束,扩展符合成像原理的3D样本集。在KITTI数据集上实验表明,所提算法整体优于基线模型,且针对边缘截断目标相比基线模型精度提升29.8百分点。
