计算机应用研究杂志2025年第3期
-
- 异构联邦学习在无人系统中的研究综述
- 俞浩,范菁,孙伊航,
- 异构联邦学习(heterogeneous federated learning,HFL)是一种用于解决数据和设备异构性问题的分布式机器学习方法,广泛应用于包括无人系统在内的多种场景。随着无人系统(如无人机、自动驾驶车辆)的快速发展,如何有效应对非独立同分布(non-IID)数据及设备计算能力差异,已成为提升联邦学习效率和性能的重要挑战。综述了异构联邦学习在无人系统中的最新研究进展,重点分析了数据、设备及模型异构性带来的主要问题,并总结了现有的解决方案,如分层联邦学习、模型压缩与剪枝技术在此领域的应用。还讨论了这些技术的实际应用场景,评估了它们的优缺点,并提出了未来可能的研究方向,以进一步提升无人系统中的联邦学习性能和数据隐私保护水平。
-
- 基于生成对抗网络的人脸属性合成技术综述
- 王健强,张珂,李培杰,
- 人脸属性合成技术旨在保留人脸面部图像身份信息的情况下,根据指定目标重建人脸属性,从而在源图像上合成具有全新属性的人脸。计算机视觉技术的发展为人脸属性合成技术提供了全新的解决方案。为此,从人脸属性合成数据集、传统和生成对抗网络(GAN)的合成网络以及人脸语义方面综述了人脸属性合成技术的发展。首先分析了人脸属性合成领域中传统方法和主流的深度学习方法,探讨基于GAN方法的发展现状,将基于GAN的人脸属性合成模型划分为有监督、无监督以及半监督三种,将人脸属性划分年龄、表情和妆容三大类语义,并对多种合成模型进行深入研究。其次,对典型的损失函数进行分析和总结,同时介绍了常用人脸属性数据集以及评价指标。最后介绍现有人脸属性合成方法面临的问题,并对该领域未来的发展提出展望。
-
- 基于深度学习的前沿视频异常检测方法综述
- 李南君,聂秀山,李拓,邹晓峰,王长红,
- 视频异常事件检测逐渐成为计算机视觉领域的研究热点之一,具有重要研究意义和应用价值。近年来,以卷积神经网络为核心的深度学习技术在多项机器视觉任务中展现优异性能,极大地启发了其在视频异常事件检测领域的应用。为此,对近年来基于深度学习的视频异常事件检测相关研究进行全面梳理与系统归纳。首先,根据视频异常检测实现流程的三个核心要素,即检测模式、样本设置及学习/推理机制,提出一种由浅入深的多级分类方案,面向前沿深度学习方法开展逐类概述并提炼代表性算法数学模型,同时聚焦现有方法的局限性进行阐述;其次,介绍本领域主流的基准测试数据集,汇总并对比当前先进方法在不同数据集上的检测性能;最后,围绕复杂光照/天气条件、多模态图像显著融合、可语义解释及自适应场景感知四个方面对未来重点研究方向进行讨论和展望,期望为该领域的后续研究提供借鉴与参考。
-
- TSD-PBFT:基于信誉和标准差聚类的PBFT共识优化算法
- 张丽,邓小鸿,石亦燃,刘勇,刘力汇,
- 针对实用拜占庭容错共识算法中存在缺少对恶意节点的惩罚机制、通信开销大、主节点选取安全性不足等问题,提出了一种基于信誉和标准差聚类的PBFT共识优化算法TSD-PBFT,旨在提高共识效率和安全性。首先,建立节点动态和静态结合的信誉评估模型,通过实时监测节点投票数和参与度来动态评估节点行为,并剔除恶意节点来提高整体共识效率和可靠性,同时通过周期性地重置高信誉值节点的评分,防止单一节点或小团体长期主导共识过程;其次,提出基于信誉和标准差的聚类算法,引入标准差逐步选取密度高且信誉良好的节点作为聚类中心,避免局部最优解;同时采用改进的K-medoids聚类算法将节点分组并形成两层,实现分层共识来降低共识过程的通信开销;最后,优化主节点选取方式,由聚类中心节点投票产生主节点,通过赋予信誉高且标准差低的节点更高的投票权重来降低恶意节点担任主节点的概率,提高主节点选取的安全性和公正性。实验仿真结果表明,在相同的网络设置和节点数量条件下,与PBFT相比,TSD-PBFT算法平均吞吐量提高了72.1%,平均时延降低了50.2%。与现在类似PBFT改进算法相比,TSD-PBFT也具有明显的性能优势,能更好的适用于大规模联盟链场景。
-
- S-Raft:一种增强拜占庭和崩溃容错的Raft算法
- 王壮,徐成,代松银,刘宏哲,李学伟,
- 传统的Raft共识算法在私有链中因其简洁和崩溃容错而得到广泛应用,但无法解决拜占庭节点恶意行为导致的诸多问题。在深入分析现有研究成果的基础上,提出了一种基于Raft的增强拜占庭和崩溃容错的共识算法:S-Raft(Stability-Raft),以解决拜占庭节点在选举中伪造身份、投票分裂以及非法替换领导者等核心问题。引入故障心跳日志机制,通过广播故障信息阻止拜占庭节点获得多数选票;实施选举超时周期优化策略,以应对投票分裂问题;提出节点稳定性评估算法,结合连续性惩罚和时间衰减因子,准确评估节点稳定性,减少因频繁故障引发的通信冗余。实验结果显示,与Raft和PBFT等算法相比,S-Raft算法在拜占庭容错能力上取得了显著提升,同时保持了较高的吞吐量和较低的共识时延。因此,S-Raft算法具有良好的拜占庭和崩溃容错能力。
-
- 基于区块链的动态多用户可搜索加密方案
- 刘欢,邓伦治,李滨瀚,
- 单用户可搜索加密方案无法满足多用户环境下的数据分享需求,且存在密钥泄露风险。为此,利用(t,N)秘密共享结构和区块链技术构造了一个基于身份的多用户可搜索加密方案。该方案解决了多用户环境下的数据分享和机密性问题,实现了用户的动态更新功能,防止了密钥泄露,并在标准模型下被证明能够抵御关键字猜测攻击。与五个现存的相关方案相比较,该方案在计算成本上表现出效率优势,适用于云储存环境下的数据分享。
-
- 基于多粒度增强和答案验证的法律文书阅读理解模型
- 王婧蕾,徐建,
- 近年来法律文书阅读理解逐渐成为一个研究热点,它要求模型能够利用有限的数据完成答案分类以及证据和答案的提取,然而现有模型编码粒度单一,且问题和法律文书之间仍缺乏充分的交互。为了解决上述问题,提出了一种基于多粒度增强和答案验证的法律文书阅读理解模型。该模型首先使用多粒度编码模块,以字符、词语和序列三种粒度来捕捉输入文本中多层次的信息,提高模型提取信息的能力;然后引入基于问题和证据的注意力,增强问题和法律文书之间的交互,深入挖掘答案分类的线索信息;最后受到人类阅读过程的启发,该模型采用答案验证机制结合局部和全局信息来预测答案。在中文法律阅读理解数据集CAIL2019、CAIL2020和CAIL2020-Enhanced以及英文数据集HotpotQA上的实验结果表明,所提方法的joint F1分别为76.48%、64.16%、70.82%和69.39%,优于基线模型。
-
- 基于问题导向式提示调优小样本文本分类
- 翟梦鑫,周艳玲,余杭,
- 低资源场景下提示调优比带有额外分类器的通用微调方法(fine-tuning)分类性能好,但提示调优中设计一个较好的提示模板和标签词映射器需要花费大量的精力。针对该问题,提出问题导向式提示调优的小样本分类方法(question-oriented prompt-tuning,QPT)。首先,利用数据集标签和可训练的连续提示构建提问形式的模板,通过预训练模型学习到最优提示模板;然后,每条样本用模板进行填充,将文本分类任务转换成完形填空任务;最后,使用外部知识及两种细化方法构建标签词映射器,通过预测的标签词与分类标签的映射关系得出分类结果。在公开数据集AG’s News和IMDB上进行实验,结果表明,该方法在5-shot、10-shot和20-shot任务上性能均有所提升,在5-shot任务上准确率分别提高了0.81和1.36百分点,与基线模型相比,不仅易于实现且性能取得了最优。
-
- 一种面向知识图谱多跳问答的分层语义解析方法
- 周岩,范永胜,孙松,周粤,
- 在知识图谱多跳问答任务中,问题的复杂语义往往难以被完全理解,这常导致回答的准确性低于预期。为此,提出了一种名为HL-GPT(hierarchical parsing and logical reasoning GPT)的新型框架。该框架利用大语言模型的理解和生成能力,通过分层解析复杂语义及构建逻辑推理路径,以提升问答任务的准确性。研究方法包括三个阶段:首先,通过大语言模型从问题的不同层次中解析出关键实体和多层关系,并将这些信息转换为逻辑形式;其次,将这些逻辑形式与知识图谱中的数据进行映射,并逐步检索相关实体以构建逻辑推理路径;最后,利用大语言模型固有的推理能力,整合问题和逻辑路径以生成准确的答案。本框架在MetaQA、COKG-DATA 、AeroQA和NLPCC-MH四个数据集上进行实验,实验结果表明,HL-GPT相比基线模型有明显的性能提升。
-
- 结合对比学习和双流网络融合知识图谱摘要模型
- 赵霞,王钊,
- 提出了一种融合对比学习与双流网络的新型知识图谱摘要模型(KGDR-CLSUM),旨在解决现有模型在生成摘要时存在的事实性错误和信息提取不足的问题。该模型通过设计双流网络同时处理文本特征和知识图谱特征,并采用对比学习来强化这两类特征的有效融合。此外,引入动量蒸馏策略以降低知识图谱中的数据噪声,从而提升摘要生成的质量和准确性。在CNN/Daily Mail数据集上,KGDR-CLSUM相较于基线模型PEGASUSBASE,在ROUGE-1、ROUGE-2和ROUGE-L指标上分别提升了3.03%、3.42%和2.56%,在XSum数据集上更是达到了7.54%、8.78%和8.51%的显著提升。此外,人工评分显著高于ChatGPT,进一步证明了该模型的优越性能。结果表明,KGDR-CLSUM在生成摘要时,尤其在短文本生成任务中,能够有效降低错误信息,并显著提高摘要的质量。
-
- 多关系和时间增强的知识追踪模型
- 张维,罗佩华,龚中伟,李志新,宋玲玲,
- 现有知识追踪方法未能深入探索知识点间多种关系并同时考虑知识相互作用和时间对知识状态的影响。鉴于此,从知识间多种关系和学习遗忘规律两方面改进知识追踪模型,提出多关系和时间增强的知识追踪模型(MRTKT)。首先,根据认知同化理论丰富了知识间关系,使用统计学方法构建了包含上位学习、下位学习以及并列组合学习三种关系的知识结构图;其次,对知识间相互作用进行建模,根据上述三种关系聚集节点特征,使得模型可以更好地模拟知识间的影响传播行为;然后,构建融入三种时间信息的GRU门更新学生知识状态,以模拟学习和遗忘对知识状态的影响,使得各节点特征包含知识间相互作用信息和时间信息,为预测学习者答题表现提供更全面丰富的信息。在多个公开数据集上进行实验,结果表明MRTKT比现有模型具有更优越的性能以及更好的可解释性。
-
- 基于能量聚焦和改进变分模态分解的人体生命体征检测算法
- 孙绪杰,黄晓红,邓振淼,
- 针对调频连续波(frequency modulated continuous wave,FMCW)雷达生命体征检测在存在大规模的随机人体运动场景中检测准确性过低的问题,提出了一种高精度的人体生命体征检测算法。该算法首先通过能量聚焦选取胸部最佳距离窗,消除运动伪影的干扰;然后利用多项式拟合距离窗序列,消除距离窗的剧烈跳变,准确提取相位信号;最后,通过基于自相关功率谱密度与加权排列熵的改进变分模态分解(variational mode decomposition,VMD)算法去除相位信号中的大规模随机人体运动成分,进而可以精确估计出生命体征信号的呼吸速率(RR)和心率(HR)。使用77 GHz雷达模拟生活场景中存在大规模随机人体运动时的生命体征检测实验,尽管人体前后晃动的幅度达到20 cm,RR和HR的估计精度依然可以达到97.7%和96.9%,与RETF-TVF-EMD算法对比,精度分别提高了5.2和2.7百分点,与IAP-VMD算法对比,精度分别提升了14.3和7.9百分点,实验结果证明该算法能够精确估计大规模随机人体运动场景下的生命体征参数。
-
- 背景图增强的社交网络重要节点自适应排序算法
- 冯俊又,陈李舟,刘先博,徐煊翔,杜彦辉,
- 社交网络中的重要节点对网络结构和功能具有决定性影响,开发精度更高的重要节点排序算法成为当前的研究热点之一。其中,LR(LeaderRank)引入一个背景节点明显提升了经典PageRank排序算法的性能,但仍面临着网络中小出度用户的投票权偏见问题。因此,提出背景图增强的社交网络重要节点自适应排序算法AGR(adaptive GraphRank),构建多节点背景图替代LR的单一背景节点,基于H指数设计有偏向的随机游走,缓解投票权偏见。调参实验初步确定了背景图的最优规模和结构;与K-TOPSIS等现有优秀算法进行对比实验,验证了AGR在传播、瓦解、鲁棒性三个关键维度上的性能提升;实际案例检验了算法在真实场景下的有效性。综上,AGR有效缓解了投票权偏见,提高了排序精度,展示出较优的性能和应用潜力。
-
- 基于自适应噪声和动态加权的联邦学习算法
- 王红林,薛珊,朱丞,
- 将差分隐私应用于联邦学习是保护训练数据隐私的有效方法之一,但在现有的算法中,添加固定噪声进行模型训练会导致模型精度不高、数据隐私泄露的问题。为此,提出了一种基于自适应噪声和动态加权的联邦学习算法(DP-FedANAW)。首先,考虑到梯度的异质性,该算法为每个客户端预测当前轮次梯度范数,获得裁剪阈值,为其进行不同轮次自适应裁剪梯度,从而实现自适应调整噪声;其次,为了进一步提高模型的训练效率,该算法还提出了一种将客户端贡献度与数据量相结合的动态加权模型聚合方法。实验结果表明,该算法在满足差分隐私的前提下,与DP-FL和其他两个自适应噪声的算法相比,不仅准确率提高了5.03、2.94和2.85百分点,而且训练轮次整体提高了5~40轮。
-
- 基于序列图时空增强与地理关系的兴趣点推荐
- 刘超,朱军,
- 针对现有兴趣点(points-of-interest,POI)推荐存在的地理特征挖掘不充分与未将顺序信息纳入空间偏好的问题,提出基于序列图时空增强与地理关系(spatial-temporal enhancement of sequence graph and geographical relationships,STESGGR)的POI推荐模型。首先,利用POI位置信息构建地理图,采用图卷积网络(graph convolutional network,GCN)与注意力机制获取用户访问POI的地理特征。其次,利用用户签到信息提取时空特征构建时空信息增强的序列图,采用门图神经网络(gated graph neural network,GGNN)与注意力机制获取用户访问POI的时空偏好。然后,引入共同性学习优化框架学习顺序信息与地理特征之间的互补信息,进一步挖掘地理特征。最后,融合两个特征信息并通过多层感知机(multilayer perceptron,MLP)进行POI推荐。在五个真实数据集上进行了实验,结果表明STESGGR模型在AUC和Logloss指标上分别提升1.2%~2.7%和3.2%~12.4%。实验证明STESGGR在基于位置的POI推荐下有较好的表现,充分挖掘了顺序与地理特征,提升了推荐效果。
-
- 基于判别增强大语言模型微调的医学影像报告生成
- 钱乾,孙丽萍,刘佳霖,杜慧江,凌晨,
- 自动化的医学影像报告生成可以提高影像医生的工作效率。传统的医学影像报告生成方法大多数基于判别式和图像描述生成式,在准确性、流畅性、多样性方面存在不足。基于大语言模型微调的医学影像生成技术有望改善以上问题。在预训练多模态大语言模型基础上,提出一种判别增强的微调方法——MedVLM。以影像诊断作为辅助的判别目标,引入低秩自适应微调法、提示微调法以及冻结微调法,来微调多模态大语言模型的特征提取模块、视觉-语言转换模块以及大语言模型模块,使其能够准确诊断肺部CT影像的疾病,并生成准确性更高的肺部CT影像报告。所提方法的BLEU@4得分率为40.85%(40.41%~40.94%),METEOR得分率为70.56%(70.37%~70.8%),生成报告的肺炎诊断准确率为87.67%(86.06%~87.39%)。显著超越传统的图像描述方法。判别增强大语言模型微调的医学影像报告生成方法,可以显著提高肺部CT影像报告生成的准确性,具有广泛的应用潜力。
-
- 大规模符号网络划分的学习驱动型扩展变邻域搜索算法
- 陶子君,陆芷,蒙炳金,
- 给定一个无向图,符号网络划分问题(signed graph partitioning problem,SGPP)是将节点集合划分为K(K≥2)个互不相交的非空分组,旨在最小化所有位于分组内的负符号边权重之和加上位于分组之间的正符号边权重之和,使网络划分结构尽量趋于平衡。SGPP是NP难问题,在计算机视觉、社交网络分析、生物信息学等实际领域中具有重要应用。但大数据时代的到来给求解大规模SGPP带来一定的挑战。因此,设计新颖且高效的学习驱动型扩展变邻域搜索算法(learning driven extended variable neighborhood search,LDEVNS)来求解SGPP。具体来说,该算法设计全新的快速增量更新策略以及高效的扩展变邻域搜索,同时结合强化学习机制来调整算法搜索过程中的前进方向,进一步探索更有希望的解空间区域来找到更高质量的求解方案。实验部分使用15组大规模社交网络图来评估LDEVNS的高性能,实验结果显示,LDEVNS在求解质量和计算时间方面相较于当前表现最佳的算法具有显著优势,同时也验证了强化学习在LDEVNS中的有效性。
-
- 基于Boosting优先经验重放的协同计算卸载方法
- 黄毅,王文轩,崔允贺,陈意,郭春,申国伟,
- 现有计算卸载方法没有考虑终端设备和边缘服务器的不同任务排队情况,导致计算卸载模型的时延估计存在偏差。更重要的是,现有基于强化学习的计算卸载方法通过计算时序差分(temporal difference,TD)误差进行经验重放,无法精确评估历史经验的重要性,导致卸载决策精度降低。为解决上述问题,在移动蜂窝网络边缘计算场景下,考虑多设备、多服务器的计算卸载问题,提出一种基于Boosting优先经验重放的协同计算卸载方法—COOPERANT。针对任务调度问题,COOPERANT构建了终端设备任务排队模型及服务器任务排队模型;针对任务卸载问题,COOPERANT设计了融合Boosting的优先经验重放算法、任务卸载联合优化模型、计算卸载多智能体深度强化学习模型及COOPERANT网络更新策略。实验证明,相比于遗传算法、蚁群算法、鲸鱼优化算法、MADDPG算法、TD-MADDPG算法以及MAPPO算法,COOPERANT能够有效降低系统时延和能耗开销,提升网络收敛速度。
-
- 求解分布式约束优化问题的邻居忽略策略局部搜索算法
- 石美凤,贾国艳,
- 针对现有基于局部搜索思想的分布式约束优化问题求解算法存在容易陷入局部最优的问题,提出了一系列用于求解分布式约束优化问题(DCOP)的基于邻居忽略策略(NI)的局部搜索算法,以扩大对解空间的搜索,避免陷入局部最优。为了研究智能体之间约束关系的可变性和随机性对局部搜索的影响和极值对于局部搜索的影响,分别设计了单个随机邻居忽略策略和极值邻居忽略策略。同时,基于单个邻居随机忽略策略和极值邻居忽略策略,设计了用于平衡算法探索和开发能力的混合策略。此外,还设计了多个邻居随机忽略策略,以探讨求解DCOP时同时随机忽略多个邻居的可行性,并在理论上证明了随机邻居忽略策略对智能体之间的约束关系没有影响。将提出的一系列基于邻居忽略策略的局部搜索算法与十种先进的非完备算法在三类基准问题上的寻优结果进行了实验对比,结果表明所提一系列用于求解DCOP的基于邻居忽略策略的局部搜索算法显著优于目前先进的非完备算法。
-
- 一种带有三重选择机制的多种群多策略差分进化算法
- 宋晓宇,李敏,赵明,
- 针对差分进化算法(differential evolution,DE)在寻优过程中易陷入局部最优以及求解精度不高的问题,提出一种带有三重选择机制的多种群多策略差分进化算法(TSMDE)。该算法采用分层种群结构,利用适应度值将种群划分为三个子种群,且子种群的大小随迭代动态调整。同时,采用五个改进的突变策略以及不同的参数自适应方式,以满足个体在不同进化阶段的开发与探索需求。为了充分发挥多种群的优势,提出一种高效的信息共享机制——三重选择机制。各子种群先根据不同模式选择执行突变的个体,然后该个体根据自身进化状态选择合适的突变策略,最后判断出该个体处于停滞状态后从两个外部存档中选择一个候选解进行替换,最终通过三重选择机制引导整个种群的进化进程。最后,将TSMDE与13个先进的差分进化(DE)变体进行对比,以验证TSMDE的有效性。在CEC2014测试集中的30个基准函数上的实验结果表明,该算法在求解精度、避免陷入局部最优等方面的能力优于或比得上这13个先进算法。
-
- 融合人工势场的改进RRT*机械臂料框分拣路径规划
- 罗轩,陈新度,吴磊,刘跃生,陈玉冰,麦展浩,陆星宇,
- 为使机械臂在料框分拣应用中快速规划出较优的拾取路径,提出一种融合人工势场的改进RRT*(rapidly-exploring random tree*)机械臂路径规划方法。首先,利用人工势场进行预规划,在预规划路径上找到能够与目标节点无碰撞直连的路径节点,并将其作为RRT*的规划目标节点,避免对空白区域的无用搜索。其次,在RRT*算法基础上加入目标引导采样以及搜索参数自适应计算策略,提高算法的指向性以及鲁棒性。引入一种基于机械臂末端姿态约束的采样节点拒绝机制,降低有效性检查次数,提高规划效率。最后,对生成的原始路径进行剪枝优化,降低路径代价与转角数量,随后利用准均匀三次B样条结合四元数球面姿态插值进行平滑优化,提高路径质量。实验结果表明,所提出的改进算法与RRT*算法相比,规划成功率提高了12.66%,规划时间与路径成本分别降低了79.05%以及34.80%。通过消融实验证明了各部分改进的有效性。在硬件平台上进行分拣测试,验证了该方法的实用性。
-
- 融合Wi-Fi与激光的机器人室内大型环境SLAM
- 熊壮,刘冉,郭林,肖宇峰,
- 同步定位与地图构建(SLAM)是实现移动机器人自主导航定位的关键。针对室内大型环境下激光SLAM闭环检测容易产生错误闭环,导致机器人位姿估计误差较大的问题,提出了一种融合Wi-Fi与激光信息的图优化SLAM算法。首先,构建Wi-Fi指纹序列与激光子地图;然后,根据每对指纹序列的相似度均值和标准差筛选用于闭环检测的激光子地图。在此基础上,提取所筛选子地图的特征点并匹配,以确定激光闭环;最后,通过图优化方法融合里程计与激光闭环,优化机器人的轨迹并构建全局地图。在170 m×30 m和180 m×80 m的室内环境中采集了三组数据,对所提算法性能进行验证。实验结果显示,所提算法的定位精度在三组数据上分别达到0.78 m、0.67 m和0.89 m,与激光SLAM算法相比分别提升了48.6%、53.1%和68.7%,证明所提算法有效提高了室内大型环境下激光SLAM的位姿估计精度。
-
- 多目标双元闭环供应链回收连锁店选址模型及优化算法
- 魏欣,张宇恒,张惠珍,马良,
- 为推进各类资源节约集约利用,提高废弃物回收和利用效率,考虑了竞争存在下的利润最优化问题,从逆向供应链视角,基于博弈理论构建了包含制造商、回收商、回收竞争商,以及消费者在内的混合竞争回收渠道双元闭环供应链系统;并同时以建设服务成本最小化、客户满意度最大化、回收利润最大化为目标,建立多目标双元闭环供应链回收连锁店选址模型。借鉴蘑菇繁殖生长机制的原理,以繁殖过程中菌落思想为核心,结合Pareto非支配解集算法设计了改进的蘑菇繁殖算法,对多目标选址问题进行优化求解。实验结果验证了模型的可行性和算法的有效性,并通过比较竞争者价格敏感度与交叉价格敏感度对优化目标的影响,为回收连锁店选址决策提供了参考。
-
- 考虑非邻近节点空间相关性的交通流预测模型
- 闫光辉,李鸿涛,张斌,常文文,
- 针对现有的交通流预测模型存在难以对非邻近节点之间的时空相关性显式建模的问题,提出一种新的利用超图表征空间相关性的超图卷积神经网络模型(double attention hypergraph convolution neural network,A2HGCN)。首先,通过寻找节点之间的相似关系构造超边,利用节点之间的连接关系构造超图;然后提出一个超图卷积模型,其中利用超图卷积和将超图线扩展为图后利用线图卷积来捕获潜在的空间相关性;再利用融合双层注意力机制的卷积长短时记忆网络捕获时间相关性,最后得出预测结果。在数据集PEMS-BAY中,A2HGCN方法的评价指标MAE、MAPE和RMSE在预测步长为15 min时为1.223、2.617%、2.547,30 min时为1.554、3.541%、3.420,60 min时为1.867、4.578%、4.224。在数据集PEMSM中,该方法的评价指标MAE、MAPE和RMSE在预测步长为15 min时为1.858、4.385%、3.339,30 min时为2.374、5.775%、4.362,60 min时为3.046、7.713%、5.479。结果表明,该方法在不同预测步长下均优于基线模型,验证了考虑非邻近节点之间的时空相关性对于提高交通预测准确性的有效性。由此可得,超图卷积神经网络在捕获时空相关性方面具有优势。
-
- 基于事后筛选经验回放的机器人深度强化学习跟踪控制
- 易佳豪,王福杰,胡锦涛,李醒,罗俊轩,
- 针对机械臂轨迹跟踪问题,提出了一种结合事后筛选经验回放(selective hindsight experience replay,SHER)的深度强化学习(deep reinforcement learning,DRL)控制方法。此算法将SHER与深度确定性策略(deep deterministic policy gradient,DDPG)结合进行机械臂的轨迹跟踪控制。SHER算法将智能体探索的经验进行随机抽取,然后筛选有用经验修改奖励函数,通过提高对正确动作的奖励评分加强对智能体正确动作的正反馈强度从而提高智能体探索效率。为了验证方法的有效性,通过欧拉-拉格朗日建模二自由度机械臂并在具有干扰的复杂环境下进行仿真实验对比。实验结果表明,所提算法在机械臂轨迹跟踪任务中收敛速度以及收敛稳定性与对比算法相比最优,并且训练出来的模型与对比算法相比在轨迹跟踪任务中表现最好,验证了算法的有效性。
-
- 基于脉搏波信号相空间重构与时间序列预测的身份认证系统构建
- 傅幼萍,张航,厉梦菡,孟濬,
- 旨在探讨光电容积脉搏波(photoplethysmography,PPG)信号的动力学特征对身份识别系统准确率的影响,并提出一种新的身份认证方法,以填补该领域对脉搏波信号动力学特征研究的空白。通过对脉搏波信号进行非线性混沌特性分析,重构其动力学系统的等价拓扑空间,并结合相空间重构技术与长短期记忆网络(long short-term memory,LSTM)模型,构建脉搏波信号的建模、预测和身份认证框架。成功实现了基于PPG信号的身份认证,对采集数据和公开数据集进行分析,评估了所提方法的性能和泛化能力,结果表明该方法在身份识别准确率上优于既有方法。最后,证明了PPG信号的动力学特征在身份识别中的重要性,并展示了结合相空间重构和LSTM模型的有效性,进一步探讨了远程光电容积脉搏波描记法(remote photoplethysmography,rPPG)作为生物识别特征的应用潜力。
-
- 基于小样本和随机化的跨域人体动作泛化识别模型
- 胡明,许佳炜,赵立军,王杨,欧阳少雄,后海伦,
- 随着IEEE 802.11bf标准的发布,WiFi感知技术已从学术研究走向工业应用。针对现有人体动作识别在域内能够准确感知,但面对跨域场景时模型识别性能差的问题,提出了一种基于小样本和随机化的跨域人体动作泛化识别模型SSRCD-Fi。首先,使用特征提取器将输入样本映射到向量空间,实现同一动作的样本聚集、不同动作的样本分离;然后针对新的场景域,通过随机化方法和少量被标记样本计算出动作的原型表示;最后,计算查询样本与动作原型之间的距离,从而实现了人体动作的分类。实验结果和分析表明,SSRCD-Fi能够实现鲁棒的跨域人体动作的泛化感知,在不可见的用户和位置上实验准确率分别为92.73%和97.99%。实验代码公开在:https://github.com/4three2one/SSRCD-Fi。
-
- 基于高效调优方法的统一高效微调架构及应用
- 陈帅良,田彦山,董力鸣,段晓英,李佳辉,
- 为解决大规模参数调优问题,一系列高效微调方法诞生,但是在整合不同高效微调方法形成有效统一整体方面还存在挑战。此外,统一调优思想在视觉任务中的应用仍然不足。因此,提出统一参数高效微调架构ETTA(efficient Transformer tuning architecture)。首先通过适配器与前缀调优工作原理的相似性,得出两种方法整合形成统一调优架构的合理性;其次,在适配器选择上,选用效果更好的并行适配器,同时对前缀调优引入可调标量得到缩放前缀调优变体;然后将两种方法整合形成统一调优架构ETTA,把并行适配器作用于Transformer前馈神经网络层并设置较大瓶颈维数,缩放前缀调优作用于多头注意力层并设置较小可调前缀向量数;最后将ETTA用于6个图像分类或目标检测任务,并与三种调优策略进行性能比较。结果表明,采用统一参数高效调优架构后,只对少量参数进行微调就可以接近参数完全微调的效果同时性能良好。证明了ETTA用于计算机视觉任务的有效性及其性能表现。
-
- 以目的地为导向的基于成本优化的电动汽车充电导航策略
- 申利民,常晓彤,李成宇,赵国瑞,毛鹏皓,
- 为了解决目的地导向的电动汽车路径规划和中途充电站选择问题,提出一种以目的地为导向的基于成本优化的电动汽车充电导航策略。首先,构建了基于目的地的电动汽车路径规划和充电导航架构;其次,根据市区道路和高速公路路网的特点,将道路划分为低层道路和高层道路两个层次;考虑到用户充电和行驶成本以及结束充电后继续前往目的地的需求,低层路网内构建决策函数进行充电站选择并进行路径规划,高层路网使用改进的蚁群算法给出全程充电策略;最后,以某市城区和某高速公路为研究范围,对所提方法进行仿真验证,并与其他方法进行了比较。结果表明,在高层和低层路网中,所提出的充电导航策略能降低电动汽车的行驶和充电成本,而且确保低层路网中电动汽车充电完成后更快速地到达目的地。
-
- 基于交通路网权重学习的城市机动车多样化轨迹生成
- 王浩权,郑皎凌,乔少杰,帅俨殊,刘双侨,曾宇,
- 基于GPS数据的轨迹生成方法因隐私保护与成本高的问题而难以应用,提出一种基于卡口数据生成车辆轨迹的方法。但其面临以下挑战:首先由于卡口覆盖率低导致拍摄的轨迹不连续,无法兼容现有模型,且未有工作研究如何有效填补缺失轨迹;其次现有模型忽略路网约束,生成轨迹无法进行仿真;最后现有模型无法生成多样化轨迹,导致可用性较差。为解决以上挑战,首先设计了TrajGAT-A*模型,通过图神经网络构建包含实际交通信息的路网拓扑图,使用聚类算法构造出功能区网络并利用图注意力网络挖掘路网特征,生成路网权重图后执行A*算法重构出连续轨迹。接着设计β-TrajVAE模型,通过聚类算法将路网划分为簇内外路段并执行分区采样,在损失函数中加入超参数以控制精度与散度之间的平衡,生成多个制导图后执行A*搜索生成多样化轨迹。基于重庆数据进行实验验证,结果显示重构轨迹在precision、recall、F1指标上均优于现有模型,生成轨迹在cross-entropy上优于现有生成模型,并通过仿真实验证实该方法可生成符合真实交通状况的轨迹。
-
- 基于信任度累积的联邦协作频谱感知
- 梁燕,孙永鑫,
- 针对低信噪比下协作频谱感知(CSS)的检测概率低且易受表现较差节点干扰的问题,提出一种基于信任度累积的联邦协作频谱感知方法(FL-CSS)。该方法分为离线训练和在线检测两部分:在离线训练部分设计了模型融合和更新策略,保证了次用户(SU)本地模型的性能,并避免全局模型受到表现较差SU的干扰;在线检测部分设计了数据融合策略,提出信任度累积算法为SU分配权重,综合考虑了SU在模型融合中的权重、在上一次决策中的表现以及决策的历史因素的影响。FL-CSS针对CSS中SU所处环境条件不同和数据融合时易受干扰的情况,保证了检测概率,提高了融合数据决策的准确率。仿真结果表明,该方法提高了低信噪比下的检测概率,并且能有效应对干扰和攻击行为,优于当前已有的协作频谱感知方案。
-
- 高速飞行器自组网快速高效加权分簇算法
- 张琳权,任智,杨建军,王淮,张伟,
- 针对高速飞行器自组织网络中组网时间较长、维护开销较大、网络恢复较慢等问题,提出了一种快速高效的加权分簇算法。该算法与现有的加权分簇算法进行了比较,对平均节点间距离、平均移动相似度以及节点度三个指标进行了改进;针对梯度抑制导致的组网周期延长问题,优化了现有的组网流程;针对备用簇首维护开销较大的问题,提出了一种高效备用簇首选举和跨层通告机制;针对簇首节点突发损坏的情况下,簇成员反应较慢的问题,提出了一种簇成员快速响应切换机制。通过OPNET软件进行仿真模拟,该算法在组网时间、控制开销及恢复时间等指标上,相较于现有加权分簇算法均有一定提升。仿真结果表明,该算法能够有效提升网络性能,更加适用于复杂环境下的高速飞行器自组织网络。
-
- 水声网络基于优先级与可Zigzag解码的在线喷泉码
- 杜秀娟,王玉杰,柳秀秀,赵建,
- 水声网络(underwater acoustic network,UAN)具有长传播时延、高误码率、半双工通信等特性,这些特性严重影响了UAN中数据的可靠传输。而在线喷泉码具有在线控制、编解码复杂度低、码率自适应等诸多优势,在线喷泉码适合于保障UAN中数据的可靠传输。针对递归与限制反馈的在线喷泉码(recursive OFC with limited feedback,ROFC-LF)存在不理想覆盖和4元环问题导致略高的开销和频繁的反馈,提出适用于UAN的基于优先级与可Zigzag解码的ROFC-LF(priority-based and zigzag-decodable ROFC-LF,P-ZROFC-LF)。P-ZROFC-LF在建立阶段选取具有最高优先级的原始包进行编码直至所有原始包均参与编码。同时,引入可Zigzag解码编码,将无用编码包进行移位异或转换为有用编码包来提高解码性能。通过随机图理论,分析P-ZROFC-LF所需编码包数与原始包数之间的关系。理论分析与仿真结果表明,与大部分在线喷泉码相比,P-ZROFC-LF显著提高了反馈和开销性能。其中P-ZROFC-LF相比于ROFC-LF的反馈和开销分别减少了18%和0.0176,更适用于UAN。
-
- 基于改进3D ResNet18的多模态微表情识别
- 梁岩,黄润才,卢士铖,
- 针对微表情识别技术面临的时间特征提取挑战包括短暂性带来的捕捉难题、时空信息融合的难点、数据稀疏性导致的过拟合问题、静态特征提取方法的局限性、数据预处理对识别性能的影响,提出了一种基于改进3D ResNet的多模态微表情识别方法(IM3DR-MFER)。通过在传统3D ResNet中融入了参数精简策略和多尺度上下文感知融合策略改进3D ResNet18,在降低参数的同时提升对面部局部特征及其在广泛上下文中的信息捕捉能力。通过融合面部全局特征与光流动态特征,构建了一个双模态输入框架,从而显著提升了模型在不同维度上的特征表征能力。通过创新性地引入新型三维注意力机制(CASANet),自适应地识别并突出微表情序列中各个时间点的关键特征。经过在CASME II、SAMM以及复合数据集(CD)上的实验验证结果表明,所提方法分别取得了93.2%、88.7%和84.6%的准确率,从而验证了所提方法在人脸微表情识别任务中的有效性和先进性。
-
- 基于蝗虫视觉神经的人群汇流行为检测神经网络
- 杨旭涛,秦进,胡滨,
- 运动人群在交叉路口或通道形成独特的运动行为模式——人群汇流,易引发诸如拥挤推攘、跌倒踩踏等潜在公共安全风险,然而目前尚未有针对该人群汇流检测的计算模型研究工作报道。针对该问题,提出了一种生物启发的人群汇流行为检测神经网络(CCBDNN)。基于蝗虫视觉神经结构特性,该神经网络感知视野域中人群活动引发的视觉运动线索;借助哺乳动物视网膜方向感知机制提取人群局部运动方向线索;通过蝗虫小叶巨型运动检测器(LGMD)危险感知机理,构建尖峰调谐机制并输出表征人群汇流行为感知的神经尖峰响应。系统性实验研究表明,CCBDNN能有效检测视觉场景中的人群汇流行为,并产生具有独特偏好特性的输出响应。该工作涉及生物视感神经机制启发的动态视觉信息加工处理,可为人工智能中的人群活动检测与行为识别研究提供新方法、新思想。
-
- 一种改进的快速深度图像先验降噪模型
- 张睿,程晓慧,
- 相较于有监督深度降噪模型,仅利用给定的噪声图像本身就能完成降噪任务的无监督深度图像先验(deep image prior,DIP)降噪模型没有数据偏向(data bias)问题,具有更好的泛化能力。然而,DIP降噪模型较长的迭代训练步数导致其在执行效率方面仍有较大提升空间。为此,提出了一种改进的增速深度图像先验降噪模型(improved accelerated deep image prior-based denoising model,IADIP)。首先,使用多个主流有监督降噪模型处理输入的噪声图像,得到多个互补的初步降噪图像(称为预处理图像)。其次,以预处理图像作为网络输入并同时将预处理图像和噪声图像共同作为目标图像以降低DIP网络映射难度,为将DIP默认的4层UNet骨干网络简化为1层结构打下基础,从而大量减少迭代更新网络参数的计算代价。最后,在IADIP无监督迭代训练中,提出一种采用下采样技术实现的伪有参考图像质量度量,并基于该度量监控迭代过程中网络输出图像的图像质量,适时终止迭代训练以实现自动早停并确保网络输出图像的图像质量。当迭代终止时,IADIP网络输出图像即为最终的降噪后图像。大量实验表明:改进后的IADIP降噪模型的执行效率显著优于原DIP降噪模型,而其降噪效果也超过了当前主流的降噪算法。
-
- 融合双向感知Transformer与频率分析策略的图像修复
- 赵芷蔚,樊瑶,郑黎志,余思运,
- 现有图像修复技术通常很难为缺失区域生成视觉上连贯的内容,其原因是高频内容质量下降导致频谱结构的偏差,以及有限的感受野无法有效建模输入特征之间的非局部关系。为解决上述问题,提出一种融合双向感知Transformer与频率分析策略的图像修复网络(bidirect-aware Transformer and frequency analysis,BAT-Freq)。具体内容包括,设计了双向感知Transformer,用自注意力和n-gram的组合从更大的窗口捕获上下文信息,以全局视角聚合高级图像上下文;同时,提出了频率分析指导网络,利用频率分量来提高图像修复质量,并设计了混合域特征自适应对齐模块,有效地对齐并融合破损区域的混合域特征,提高了模型的细节重建能力。该网络实现空间域与频率域相结合的图像修复。在CelebA-HQ、Place2、Paris StreetView三个数据集上进行了大量的实验,结果表明,PSNR和SSIM分别平均提高了2.804 dB和8.13%,MAE和LPIPS分别平均降低了0.015 8和0.096 2。实验证明,该方法能够同时考虑语义结构的完善和纹理细节的增强,生成具有逼真感的修复结果。
-
- 联合时空差异注意力与层级细节增强的遥感影像变化检测
- 管宗胜,邵攀,杨子超,程泽敏,余快,
- 目前,基于U-Net的深度学习遥感影像变化检测方法包含许多伪变化信息,且多数方法缺乏层级特征间的有效交互。针对上述问题,以经典U-Net为基础,提出一种联合时空差异注意力与层级细节增强的高分辨率遥感影像变化检测方法。首先,分别提取两期影像的单时相特征与级联特征,基于两期单时相特征的欧氏距离与差值特征,提出一种时空差异注意力模块,强化级联特征对变化区域的学习;然后,利用混合空间通道注意力交互相邻层级特征间的信息,构建一种层级细节增强模块,促进特征解码;最后,结合分块策略和空洞条形卷积,设计一种轻量级的多尺度边界细化模块,提取多尺度特征并缓解边界信息的丢失。在四个常用公开数据集上的实验结果表明,该方法相比于现有8种变化检测网络,取得了最好的评价指标。
-
- DepthMamba:多尺度VisionMamba架构的单目深度估计
- 徐志斌,张孙杰,
- 在单目深度估计领域,虽然基于CNN和Transformer的模型已经得到了广泛的研究,但是CNN全局特征提取不足,Transformer则具有二次计算复杂性。为了克服这些限制,提出了一种用于单目深度估计的端到端模型,命名为DepthMamba。该模型能够高效地捕捉全局信息并减少计算负担。具体地,该方法引入了视觉状态空间(VSS)模块构建编码器-解码器架构,以提高模型提取多尺度信息和全局信息的能力。此外,还设计了MLPBins深度预测模块,旨在优化深度图的平滑性和整洁性。最后在室内场景NYU_Depth V2数据集和室外场景KITTI数据集上进行了综合实验,实验结果表明:与基于视觉Transformer架构的Depthformer相比,该方法网络参数量减少了27.75%,RMSE分别减少了6.09%和2.63%,验证了算法的高效性和优越性。
-
- 基于韦伯定律的彼得森图局部人脸特征模式
- 徐洁,邓懿之,陈建平,
- 以提升人脸特征提取和识别的性能为目标,提出了一种新型局部特征提取方法——基于韦伯定律的彼得森图局部人脸特征模式(WPLFP)。该方法巧妙地将韦伯定律融入紧凑的编码方案中,通过定义韦伯-彼得森数来精确表征目标像素与其邻域像素之间的结构信息。在特征提取过程中,WPLFP算法在中心像素的5×5窗口内有序应用彼得森图的四种空间排列,实现了对像素间复杂结构关系的全面捕获。为了深化特征提取的层次,还结合了局部二值模式和邻点到中心差异二值模式,进一步提取出邻域的深层复杂结构特征。此外,通过整合水平和垂直方向上的单尺度描述符WPLFPv和WPLFPh的直方图,构建了一个多尺度的WPLFP,该模型能够捕捉不同尺度下的结构信息,从而提高了特征提取的准确性和鲁棒性。实验结果表明,无论是单尺度还是多尺度的WPLFP,其性能均显著优于当前主流的局部特征提取算子,充分验证了WPLFP在人脸特征提取和识别领域的有效性和优越性。这不仅证实了所提算法设计的成功,也进一步展示了基于人类心理学定律进行图像处理和特征提取的巨大潜力。
-
- 复合因素影响下嫌疑人发型变化的深度模拟
- 刘耀晖,孙鹏,郎宇博,沈喆,孙德廷,宋强,
- 年龄、伪装等复合因素影响下,命案积案中嫌疑人的相貌、发型等体貌特征变化具有明显的不确定性。针对上述问题,提出双重风格迁移生成对抗网络(dual style transfer generative adversarial network,DstGAN)对人像发型变化进行模拟。首先,设计了双重StyleGAN生成器,借助人像年龄化模型,将人像年龄化信息与发型变化相结合,提高客观因素影响下发型模拟结果的真实度。其次,引入BiSeNET算法对输入人像及其目标发型进行语义分割后得到目标人像语义图,并在FS潜在空间中利用交叉熵损失函数约束GAN逆映射生成的语义图,与模拟后的语义图实现语义对齐,避免出现非自然融合现象。最后,为进一步扩充发型变化种类,通过在RM潜在空间中对发型向量进行编辑,修改输入人像发型所包含的语义属性,实现对于光头等特殊发型的模拟。DstGAN与一些经典发型变化模型相比,更加有效地保证了人脸身份特征的一致性,更加平滑地实现发型与面部边缘的过渡。同时DstGAN在PSNR、SSIM等指标评价的结果中,相比于经典发型变化模型,均取得最为优异的客观评分,表明DstGAN模拟发型变化的人像清晰度更高、感知质量更优、皮肤纹理更真实。
