2026, 35(8):1-11. DOI: 10.15888/j.cnki.csa.010213 CSTR: 32024.14.csa.010213
摘要:混合专家(mixture-of-experts, MoE)模型通过专家并行(expert parallelism, EP)推理降低单卡的显存压力, 实现专家计算的并行化. 但在带宽受限的硬件上, 频繁的All2All通信引发了严重的通信墙瓶颈. 现有主流的DeepSeek双批次并行调度方案虽能实现计算通信重叠, 却面临注意力算子因批次拆分导致的计算强度受损和计算通信因执行时间非对称导致的掩盖不充分的双重挑战, 从而实际收益有限. 针对上述问题, 本文提出一种新的混合专家模型, 采用专家并行推理时的计算通信重叠调度优化方案. 首先, 有选择性地对部分算子实施多批次计算通信重叠, 让注意力模块使用完整批次执行保证算子的计算强度; 其次, 设计基于流式多处理器分配的多流重叠调度机制, 实现计算通信更加充分的重叠. 该方案既缓解了部分算子计算强度下降的开销, 又更充分地利用了计算通信掩盖的机会. 实验结果表明, 在单机8卡H20平台部署Qwen3-30B模型时, 本方案能够将解码吞吐提升6.0%–23.6%, 是双批次并行收益的1.74–6.29倍.
2026, 35(8):12-23. DOI: 10.15888/j.cnki.csa.010252 CSTR: 32024.14.csa.010252
摘要:随着智能计算与通信技术的飞速发展, 在未知环境中实现智能传感器群的全面协同态势感知已成为可能. 然而, 障碍物遮挡会导致传感器感知效用模型失真, 从而制约群体协同态势感知能力. 为此, 本文提出一种新的基于深度强化学习的多智能体协同决策方法, 称为分布式动态感知深度Q学习算法(decentralized dynamic sensing optimization with deep Q-learning, DDSO-DQL). 该方案通过构建分布式策略网络评估状态动作价值, 设计分层探索机制提升环境探索效率, 引入历史状态回溯策略增强智能决策稳定性; 赋予移动节点自主协同感知与决策能力, 实现动态态势感知及群体全局优化. 实验结果表明, 在未知环境中, 所提算法相较于传统方法将平均态势感知率提升8.7%, 显著增强了网络协同自主性与动态感知质量, 为意图驱动网络的智能感知与自愈提供了关键技术支撑.
2026, 35(8):24-38. DOI: 10.15888/j.cnki.csa.010214 CSTR: 32024.14.csa.010214
摘要:因果解耦表征学习是从高维数据中提取具有因果语义独立性潜在因子的关键技术, 在可控生成、鲁棒分类等任务中具有重要应用价值. 现有因果解耦模型虽能通过结构化因果模型处理潜在因子间的因果关联, 但存在特征冗余抑制不足与闭环一致性缺失的问题, 从而限制了模型在医疗诊断、自动驾驶等关键领域的应用. 为解决上述问题, 本文提出一种融合闭环转录与稀疏编码的因果解耦表征学习框架, 其核心设计包括两部分: 首先, 基于最大编码率降低原则构建闭环转录机制, 通过编码器与解码器的双向博弈与动态反馈, 可有效提升解耦精准度与稳定性; 其次, 引入卷积稀疏编码层, 通过替代传统深度神经网络中的标准卷积层, 可有效剔除冗余特征. 本文在Pendulum合成数据集与CelebA真实数据集上进行了广泛的实验, 在Penulum数据集上样本效率达99.11%, CelebA数据集上样本效率达99.32%. 实验结果表明, 该框架在下游任务样本效率及分布鲁棒性上优于现有方法, 为因果解耦表征的实际应用提供了更优方案.
2026, 35(8):39-49. DOI: 10.15888/j.cnki.csa.010224 CSTR: 32024.14.csa.010224
摘要:高质量的漏洞代码数据集对于推动软件安全研究具有重要意义, 是支撑漏洞分析、漏洞检测模型训练与评测、系统对比与攻防研究的核心资源. 不同于图像等领域, 现有漏洞数据集不仅数量有限, 且质量参差不齐, 在多样性上仍存在明显不足. 为应对这一挑战, 本文提出CodeVulnGen, 一种以漏洞特征为核心、基于大语言模型(large language model, LLM)的自动化代码漏洞数据生成框架. 该框架系统化定义了代码漏洞的数据质量属性与评估方法, 在此基础上, 提出3阶段递进式提示构造策略, 将结构化描述、少样本实例、真实漏洞特征和思维链(chain-of-thought, CoT)推理逐步融合, 以生成多样、规范且更贴近真实攻击场景的高复杂度漏洞代码. 实验结果表明, 使用该数据集进行微调的Qwen-4B模型F1指标提升7.4%, 相较于基于真实数据训练提升5.5%.
2026, 35(8):50-60. DOI: 10.15888/j.cnki.csa.010202 CSTR: 32024.14.csa.010202
摘要:针对复杂场景下输电线路多类型缺陷检测精度低、单一模态易漏检的难题, 提出了一种轻量级双模态目标检测框架. 该框架采用3阶段处理流程: 首先利用EfficientNetV2-S对输入图像进行精准预分类, 然后将不同缺陷模态输入不同的检测网络中, 最后仅在同一场景存在配对双模态图像时, 启动决策级融合模块, 对两支路检测结果进行置信度加权与位置匹配, 实现可见光结构信息与红外热信息的精准互补. 实验结果表明, 所提框架在自建双模态数据集及多个公开数据集上表现出色, 红外支路对挂点温度异常缺陷F1值达0.985, 可见光支路对绝缘子结构缺陷和异物检测F1值分别达0.920和0.964, 综合性能显著优于CNN、YOLO系列等主流方法. 既支持单模态独立高效运行, 又能在双模态条件下显著降低复合缺陷与复杂光照场景下的漏检率.
2026, 35(8):61-73. DOI: 10.15888/j.cnki.csa.010254 CSTR: 32024.14.csa.010254
摘要:认证是物联网设备中关键的访问控制机制. 然而, 开发者设计或配置不当将可能导致设备中存在认证绕过漏洞, 从而显著削弱系统安全性. 为识别物联网设备是否存在认证绕过漏洞, 现有研究主要依赖对固件进行人工逆向分析以定位认证逻辑并结合符号执行技术求解可绕过认证的输入条件, 或采用启发式规则来检测漏洞. 然而, 人工逆向分析成本高昂, 而启发式规则的可扩展性有限, 导致认证绕过漏洞检测难以高效、规模化地开展. 针对上述问题, 本文提出了一种面向物联网设备的新型自动化认证绕过漏洞检测框架FirmAuth. 该框架首先通过自动识别固件中各类服务的认证特征, 定位认证相关代码的位置; 随后构建面向认证逻辑的符号执行引擎, 实现对认证绕过漏洞的高效检测. 实验结果表明, 与现有方法相比, FirmAuth的认证绕过漏洞检出率提高了约11.6倍. 目前, 基于该工具发现的相关漏洞已获得4个漏洞编号.
2026, 35(8):74-88. DOI: 10.15888/j.cnki.csa.010207 CSTR: 32024.14.csa.010207
摘要:近年来, 基于Transformer架构的大模型已在诸多领域得到广泛应用且实用效果优异, 但其核心算子在异构平台上的高效部署面临适配复杂、手工优化成本高等问题, 而且现有编译器在块级逻辑表达及跨平台性能迁移方面存在局限. 针对上述问题, 提出一种基于多层中间表示 (multi-level intermediate representation, MLIR)的高性能算子生成框架DeepGen. 该框架通过构建块级分层中间表示(intermediate representation, IR), 实现了对算子的计算模式、访存行为及并行结构的直接刻画. 同时, 设计了一套通用的跨平台优化Pass集合, 实现了对计算调度与数据访存的逐级优化. 此外, 通过将计算逻辑与数据搬运过程解耦, DeepGen为异构平台的高性能算子生成提供了统一的优化机制. 实验结果表明, 在NVIDIA A100/V100与海光Z100/K100平台上, DeepGen相比于cuBLAS 和rocBLAS的矩阵乘算子, 计算效率分别平均提升1.10倍和1.18倍. 相较于Triton, DeepGen提升Attention算子的计算效率最高达到3.71倍, 并进一步使LLaMA2与BERT模型的端到端推理性能平均提升1.76倍和2.01倍. 上述实验结果验证了DeepGen在Transformer模型的算子生成与优化中具备良好的跨平台性能可移植性与通用性.
2026, 35(8):89-101. DOI: 10.15888/j.cnki.csa.010231 CSTR: 32024.14.csa.010231
摘要:针对社会突发事件热点话题的流行度演化趋势与拐点预测的问题, 本文给出了一种融合多模态特征与时间序列建模的拐点预测方法. 首先, 结合帖子的文本与图像内容、用户影响力、级联传播结构、时间特征以及标签影响力, 构建多模态特征体系, 并利用CatBoost模型估计单帖级的流行度. 其次, 将单帖的预测结果按照时间窗口聚合, 形成话题级时间序列, 以刻画热点话题在内容、用户与传播层面的动态演化特征. 最后, 引入高效的S-Mamba模型预测热点话题的演化趋势, 并结合E-Divisive与斜率/加速度分析, 实现话题未来关键拐点的预测. 基于多个真实社交媒体突发事件数据集的实验结果表明, 本文方法在拐点预测的准确率与时间效率方面均优于多种基线模型, 同时也保持了较高的流行度预测性能, 验证了多模态特征构建与时序建模在热点话题拐点预测中的有效性.
2026, 35(8):102-116. DOI: 10.15888/j.cnki.csa.010225 CSTR: 32024.14.csa.010225
摘要:网络入侵检测系统(network intrusion detection system, NIDS)是识别潜在威胁的关键设施. 针对现有无监督入侵检测模型在异构网络中泛化能力不足, 以及主流联邦聚合方法难以有效缓解由非独立同分布(non-independent and identically distributed, Non-IID)数据引发的本地模型权重差异问题, 提出了一种基于联邦持续学习的可泛化无监督网络入侵检测系统GenFCLNIDS. 首先, 每个客户端与一个数据孤岛相关联, 并独立部署基于能量流分类器(energy flow classifier, EFC)与堆叠降噪稀疏自编码器(stacked denoising sparse autoencoder, SDSAE)的无监督模型EFC-SDSAE. EFC通过增强流量间差异来提高SDSAE的泛化能力. 随后, 通过联邦持续学习方法FedSI减小Non-IID数据导致的本地模型权重差异, 获得最优全局模型. 最后, 使用基于F1-score最大化的双阈值异常流量检测算法自适应确定检测阈值以支持精确检测. 实验结果表明, GenFCLNIDS实现了异构网络中异常流量的精准识别, 有效保护了各客户端网络流量的数据隐私, 并且在异构网络中的泛化能力方面显著优于其他方案.
2026, 35(8):117-129. DOI: 10.15888/j.cnki.csa.010238 CSTR: 32024.14.csa.010238
摘要:针对遥感图像小样本语义分割中存在的目标尺度多样性大以及跨图像语义偏移等问题, 提出一种多层特征原型网络(multi-layer feature prototype network, MLPNet), 以提升模型在小样本条件下的分割性能与泛化能力. 本文利用卷积神经网络不同层级特征生成多样化原型, 并通过自适应融合模块动态调整各层原型权重, 以增强原型的表达能力. 同时, 设计语义对齐模块, 通过迭代交互策略建模支持-查询图像间的语义关系, 有效减轻跨图像语义偏移. 进一步结合类特定区域挖掘模块, 从低置信度区域挖掘潜在目标信息并抑制高置信度误激活, 从而增强预测结果的一致性与完整性, 实现对目标的精细分割. 相较于当前主流的小样本语义分割模型, MLPNet在iSAID与LoveDA数据集的1-shot与5-shot设置下均取得了具有竞争力的性能, 尤其在iSAID数据集上对比基线模型的平均交并比(mIoU)分别提高了4.78%和4.41%. 同时, MLPNet在类别复杂、背景干扰严重的目标上有更强的目标捕获能力和更稳健的分割表现. MLPNet能够有效利用多层特征原型的表达能力, 并结合跨图像的语义对齐机制, 通过多模块协同作用增强了少量支持样本条件下对复杂目标的分割能力, 为遥感小样本语义分割提供了一种可推广、精度高的解决方案.
2026, 35(8):130-139. DOI: 10.15888/j.cnki.csa.010191 CSTR: 32024.14.csa.010191
摘要:热点事件是引发公众高度关注、广泛讨论并对社会、经济或组织产生显著影响的事件, 提前预警热点事件可有效降低风险损失. 热点事件预警是一个涉及多方、多因素、多关系的复杂场景分析问题, 传统的单一“指标-征候”关联评估体系存在指标体系丰富度低、推理过程固化等问题, 在复杂场景下易遗漏重要征候线索, 导致热点事件预警不及时. 为了解决上述问题, 本文提出一种基于动态指标网和大语言模型的热点事件预警算法. 首先, 从多群体视角构建分层分类的指标网, 建立不同群体指标体系间的耦合关系, 通过指标增强和强度分割将不同群体及群体内的指标进行分级增益, 提高征候发现和事件预警的效率. 然后, 设计了大小模型协同的热点事件预警方法, 通过大语言模型智能调度经典算法和业务数据两类模型, 并结合指标网完成热点事件预警, 预警结果通过提示工程进行自适应反馈, 生成新的指标和优化指标权重. 对比实验结果表明, 该方法可以完成复杂场景下的热点事件预警, 征候覆盖全面性和事件预警及时性得到提高, 证明了方法的有效性.
2026, 35(8):140-150. DOI: 10.15888/j.cnki.csa.010190 CSTR: 32024.14.csa.010190
摘要:针对现有入侵检测方法对边特征蕴含的流量交互模式重视不足、难以通过节点捕捉双向通信关联性, 导致入侵行为表征不全面、检测准确率受影响的问题, 提出一种基于双向图卷积网络的入侵检测模型, 旨在通过边特征增强与双向融合机制提升检测性能. 首先, 采用自适应时间窗口划分网络流量, 并以主机为节点、通信会话为有向边构建动态图; 其次, 设计基于决策树的边特征增强机制, 利用基尼指数筛选强判别力特征并构造高阶交叉特征, 丰富边特征的语义信息; 最后, 引入BiGCN分别捕获正向与反向图结构信息, 并结合动态注意力融合机制, 根据节点表示与增强边特征自适应计算融合权重, 实现节点与边特征的深度融合, 再经多层图卷积完成分类预测. 在CIC-IDS2017和UNSW-NB15上的实验结果表明, 该模型在精确率、召回率和F1-score等指标上均优于其他对比方法, 证明了其在网络环境中进行入侵检测的有效性.
2026, 35(8):151-162. DOI: 10.15888/j.cnki.csa.010189 CSTR: 32024.14.csa.010189
摘要:针对当前教育领域课程知识图谱构建效率低下的问题, 该研究旨在探索一种自动且准确的知识抽取框架, 以实现教学资源的智能化分析与结构化整理. 该框架首先利用LLM (large language model)对少量人工标注样本进行数据增强, 以扩充高质量训练集; 随后, 利用增强后的数据集对开源LLM进行微调, 结合思维链与正反例提示策略, 优化模型在实体关系抽取任务上的表现. 在材料力学课程知识抽取测试中, 本文提出的FT-CoT-ICL方法相较于传统的Zero-shot和ICL (in-context learning)方法, 在实体抽取任务上F1分数分别提高38%–43%和23%–28%, 在关系抽取任务上F1分数分别提高44%–46%和31%–35%. 使用该方法的LLM在课程知识抽取任务上显著超越了具有更大参数量的商业LLM, 节约了推理成本, 同时也优于目前的信息抽取SOTA模型. 实验结果证明, 该框架能够有效激活LLM在实体关系抽取任务上的表现, 从而自动化实现课程知识图谱构建, 展示了其在知识工程领域的应用潜力.
2026, 35(8):163-174. DOI: 10.15888/j.cnki.csa.010199 CSTR: 32024.14.csa.010199
摘要:抑郁症是一种高患病率、高复发率的精神障碍, 其早期筛查在临床实践中面临重大挑战, 现有基于生理信号的筛查方法普遍存在多模态信息利用不充分、决策过程不可解释、准确性与泛化能力有限的问题. 本文提出一种基于跨模态注意力机制的可解释睡眠分期筛查抑郁症方法. 通过构建时段与序列跨模态转换器, 融合脑电(EEG)和眼动(EOG)信号, 利用跨模态与模态内注意力机制, 实现高精度睡眠分期, 并获得可视化的分期依据. 随后, 从分期结果中提取7项睡眠结构特征, 引入具备特征选择能力的抑郁症筛查模型, 实现抑郁症筛查及关键特征解释. 在公开数据集Sleep-EDF上, 睡眠分期模型准确率达到83.57%, Macro F1 score为79.07%; 在自建数据集的抑郁症筛查任务中, 筛查模型准确率高达94.29%. 本文构建了从原始PSG信号到抑郁症筛查的端到端可解释分析路径, 为抑郁症的客观、可解释辅助筛查提供了新的技术方案.
2026, 35(8):175-184. DOI: 10.15888/j.cnki.csa.010269 CSTR: 32024.14.csa.010269
摘要:文物数字化是文化遗产保护与传承的核心手段, 三维重建与材质分解作为关键技术, 需有效复原文物的几何形态与多样材质属性. 现有方法在处理金属、陶瓷等多材质文物时, 易受高光反射干扰导致几何重建模糊, 且材质分解精度不足. 针对该问题, 提出一种基于 2D 高斯泼溅(2D Gaussian splatting, 2DGS)的文物三维重建与材质分解方法. 首先, 融合大规模视觉基础模型提供的深度与法向先验, 通过多约束损失函数优化几何重建, 缓解高光干扰导致的多视角一致性失效问题; 其次, 采用基于物理的渲染(physically-based rendering, PBR)框架与 split-sum 近似, 结合两阶段训练策略: 高斯基元直接着色初始化与G缓冲区延迟着色优化, 可输出反照率、金属度、粗糙度等 PBR 材质参数, 支持符合物理规律的高保真重光照应用. 实验结果表明, 该方法在 PSNR、SSIM、LPIPS 等指标上优于主流对比方法, 能较好地输出文物精细几何细节与材质特性, 支持高保真重光照应用, 为文物数字化保护提供可靠技术支撑.
2026, 35(8):185-192. DOI: 10.15888/j.cnki.csa.010204 CSTR: 32024.14.csa.010204
摘要:基于观测数据预测随时间推移变化的反事实结果在诸多领域具有重要意义. 当前最优方法在长序列场景下面临预测精度低与计算效率低的双重挑战, 且现有平衡策略在偏差与误差权衡方面存在明显不足. 为此, 本文提出一种基于Mamba的新型端到端深度学习框架Causal Mamba, 用于预测随时间推移变化的反事实结果, 该框架融合了Treatment-Covariate-Outcome并行Mamba模块 (TCO-TriMamba块) 与对抗-重建多任务平衡策略. TCO-TriMamba块能够高效地从历史信息中筛选关键部分进行选择性关注. 对抗-重建多任务平衡策略通过优化多个任务与该模块协同作用, 实现对时变混杂因素的有效调整, 同时保障反事实预测任务的精度. 实验结果表明, Causal Mamba在多步反事实预测任务上优于现有基准模型, 尤其在长序列下有着更高的预测精度与更短的运行时间.
2026, 35(8):193-204. DOI: 10.15888/j.cnki.csa.010203 CSTR: 32024.14.csa.010203
摘要:程序的动态链接过程中多个阶段均存在显著的安全隐患, 然而现有的控制流保护机制对动态链接过程保护较少, 且存在防御能力片面、性能开销高及硬件依赖强等局限性. 针对上述问题, 本文提出了一种面向动态链接过程的随机化安全防护机制SecLoader. 该机制通过3个核心模块的协同工作, 实现了对动态链接全生命周期的安全防护. 在加载阶段, 引入混合加密认证机制, 防止信息泄露和动态库劫持攻击; 在符号解析阶段, 设计动态库函数名随机化技术, 防御符号劫持攻击; 在地址重定位阶段, 提出GOT表随机化技术, 增加GOT劫持的攻击成本. 本文在glibc中实现了SecLoader, 具有良好的兼容性, 并对上层应用无感知. 为验证防护能力的有效性, 构建了渗透攻击测试集, 并在真实CVE漏洞上验证了防御的有效性. 此外, 本文采用SPEC CPU 2017的C语言基准测试集进行了性能评估. 实验结果表明, SecLoader能够有效防御多种对动态链接过程的安全威胁. 在性能方面, 仅在程序加载阶段引入了42.2%的毫秒级开销, 且对程序实际运行阶段几乎无影响.
2026, 35(8):205-220. DOI: 10.15888/j.cnki.csa.010262 CSTR: 32024.14.csa.010262
摘要:针对数据中心网络(data center network, DCN)中突发流量频发、拥塞反馈滞后及队列震荡严重等问题, 提出一种基于深度强化学习的显式拥塞通知网络优化(deep Q-learning explicit congestion notification optimization, DQECO)算法. 首先, 该算法以PIE队列管理机制为基础, 引入深度Q网络(deep Q-learning network, DQN)实现对显式拥塞通知(explicit congestion notification, ECN)标记概率的自适应动态调节. 其次, 通过融合队列时延、队列占用率及ECN标记比例等多维度特征, 精准感知网络拥塞状态, 实现对网络拥塞的精细化动态调控. 最后, 通过设计非线性多目标奖励函数, 引导智能体在与网络环境的持续交互中最大化长期累积回报, 实现算法性能的持续迭代优化. 为验证算法性能, 本文构建基于ns3-ai的仿真环境, 在多种场景下与NewReno、QTCP算法进行对比测试; 实验结果表明, DQECO算法综合性能优于对比算法, 在高带宽场景下, 吞吐量较NewReno提升约160%、较QTCP提升约13.4%, 平均往返时延、队列占用率及丢包率分别控制在0.08 s左右、0.2以下及0.4以下, 能有效保证吞吐量稳定、抑制队列震荡, 具有更好的稳定性与自适应能力.
2026, 35(8):221-236. DOI: 10.15888/j.cnki.csa.010248 CSTR: 32024.14.csa.010248
摘要:针对体育场景中运动员快速移动、频繁遮挡和复杂交互导致的跟踪失败问题, 提出一种面向体育场景的增强型运动自适应StrongSORT多目标跟踪框架. 首先, 引入基于贝叶斯分类和隐马尔可夫模型的概率运动状态识别模块, 将运动员行为分解为静止、常速、加速、减速和转向这5种状态. 其次, 针对高速机动引发的数值发散问题, 应用数值稳定的自适应卡尔曼滤波器, 利用控制理论中标准的Joseph形式协方差更新和有界参数自适应机制, 保证滤波器在有限精度算术下的数值稳定性. 再次, 提出融合距离交并比(DIoU)、完全交并比(CIoU)度量和图神经网络的物理信息遮挡管理策略, 实现复杂交互场景下的身份保持. 最后, 建立质量感知的外观建模框架, 通过运动状态自适应动量更新防止特征退化. 在SportsMOT数据集上的实验结果表明, 该方法的MOTA、IDF1和MT指标分别达到82.9%、85.3%和68.2%, 相较于基线StrongSORT分别提升8.3、8.8和13.5个百分点, 身份切换减少约39个百分点, 同时保持30 f/s以上的实时处理速度, 可支持在线体育视频分析.
2026, 35(8):237-246. DOI: 10.15888/j.cnki.csa.010211 CSTR: 32024.14.csa.010211
摘要:为了解决现有算法在复杂道路场景下对交通标志小目标识别精度低且容易出现漏检和误检等问题, 本文提出一种基于改进YOLO11n的交通标志检测方法TSP-YOLO. 首先, 设计了交通标志自适应检测模块TSDAM, 通过多尺度特征增强强化小目标表达. 其次, 在主干网络中改进SPPF模块, 构建IMSPPF模块, 融合最大池化、平均池化与EMA注意力机制, 有效抑制背景噪声干扰并增强多尺度上下文信息建模能力. 最后, 在C3k2结构中引入部分卷积, 设计C3k2_PConv模块, 在保证模型精度的同时减少模型的参数量. 实验结果表明, 在TT100K数据集上, 该方法将mAP50从68.7%提升至74.5%, mAP50:95从53.2%提升至58.1%, 同时, 参数量下降19.3%, 显著提升了交通标志小目标检测性能. 在CCTSDB 2021数据集上的实验结果进一步印证了该算法良好的泛化特性.
2026, 35(8):247-259. DOI: 10.15888/j.cnki.csa.010188 CSTR: 32024.14.csa.010188
摘要:在大规模并行计算场景中, 节点异常或进程挂起等故障极易引起系统性能下降, 严重影响任务的执行效率与稳定性. 现有调用栈分析工具普遍存在开销大、侵入性强及无法持续采样等问题, 难以满足大规模并行计算场景的轻量化检测需求. 为了解决上述问题, 本文基于eBPF技术设计并实现一种轻量级、非侵入式的调用栈采样及分析工具: StackProfiler, 用于并行程序的调用栈采样及性能异常检测. StackProfiler无需修改应用程序源码, 能够以较低开销精准获取整个系统层面的函数调用关系; 通过对高频函数进行分析, 可快速定位故障节点及问题进程. 结合调用上下文信息, 可进一步深入分析异常原因. 在多个基准测试程序和典型并行应用上的实验评估表明, 该工具的运行时开销小于3%, 单节点持续采集数据量不超过6 MB, 具备优异的轻量化特征与实用性; 在节点计算效率下降、残留进程干扰以及程序逻辑错误等真实场景模拟中, 均能准确地识别异常现象. StackProfiler为大规模并行程序性能诊断分析与故障定位提供了一种高效的新方案.
2026, 35(8):260-269. DOI: 10.15888/j.cnki.csa.010251 CSTR: 32024.14.csa.010251
摘要:光伏功率短期预测的精度对电网安全运行与新能源高效消纳具有重要意义. 针对光伏发电序列中频率成分复杂、空间与时间依赖特征难以协同提取的问题, 本文提出一种由自适应分解模块(adaptive decomposition module, ADM)、动态图卷积网络(dynamic graph convolutional network, DGCN)和双向长短时记忆(bidirectional long short-term memory, BiLSTM)网络组成的ADM-DGCN-BiLSTM模型. 首先, 利用ADM模块通过快速傅里叶变换(fast Fourier transform, FFT)动态分析光伏发电序列的频谱特征, 自适应地将序列分解为周期、趋势和残差这3类关键分量, 分析了主频估计精度对分解效果与模型性能的影响; 其次, 空间流采用DGCN自动学习多维气象要素间的时变空间相关特征, 时间流采用BiLSTM捕捉单站点的功率时序变化特征. 最后, 将两路特征进行融合预测. 实验结果表明, ADM-DGCN-BiLSTM模型能有效提升短期光伏功率预测精度, 性能显著优于传统方法, 为光伏发电的高效预测提供了新的技术途径.
2026, 35(8):270-283. DOI: 10.15888/j.cnki.csa.010240 CSTR: 32024.14.csa.010240
摘要:以最大完工时间和总能耗为目标, 建立了考虑自动引导小车(automated guided vehicle, AGV)变速和充电的绿色作业车间调度模型. 针对工序加工排序和AGV运输任务分配的协同优化调度需求, 考虑决策空间复杂性与动态关联性, 提出了一种多策略近端策略优化(multi-strategy proximal policy optimization, MSPPO)算法. 设计基于析取图和人工状态的复合状态特征, 为智能体提供更全面的环境信息. 结合多目标优化需求, 构建融合完工时间与能耗的复合奖励函数, 引导解向Pareto前沿逼近. 设计一种双策略协同网络架构, 工序策略网络负责工序加工排序, AGV策略网络负责AGV运输任务分配, 两个网络顺序执行构成完整的调度动作, 实现加工与运输的协同优化. 为增加策略网络间的协同性与适应性, 通过共享优势估计、策略反馈机制以及联合状态更新, 使两个策略网络在训练过程中能够动态适应彼此的决策行为, 提升算法的鲁棒性与收敛性. 通过拓展算例的实验分析对比, 验证算法的有效性与优越性.
2026, 35(8):284-293. DOI: 10.15888/j.cnki.csa.010227 CSTR: 32024.14.csa.010227
摘要:针对大规模视觉模型全量微调成本高昂, 且现有参数高效微调(parameter-efficient fine-tuning, PEFT)方法忽视视觉信号特性的局限, 本文提出了一种基于空间感知与样本自适应调控的适配器微调方法SP-Adapter. 该方法通过空间重构将一维图像序列特征还原为具备空间拓扑结构的特征图, 并利用卷积算子显式注入空间归纳偏置, 以增强模型对空间视觉特征的建模能力. 在此基础上, SP-Adapter引入了基于样本上下文自适应生成的通道注意力机制, 根据输入样本的语义差异动态重校准高维隐藏空间的特征响应权重, 从而增强任务相关的判别性视觉表征, 提升模型在下游任务中的适配性能. 在VTAB-1K和FGVC基准数据集上的实验结果表明, SP-Adapter可以在微调少量参数的情况下拥有较好的泛化能力, 其性能优于其他经典的参数高效微调方法.
2026, 35(8):294-306. DOI: 10.15888/j.cnki.csa.010228 CSTR: 32024.14.csa.010228
摘要:大型预训练模型在自然语言处理、计算机视觉等任务中展现出卓越的性能, 但在适配具体下游任务时仍需进行微调. 随着模型规模的持续增长, 现有参数高效微调(parameter-efficient fine-tuning, PEFT)方法在训练与推理阶段仍面临较高的计算与存储开销, 限制了其在资源受限场景中的应用. 针对上述问题, 本文提出一种基于分组参数共享的跨层参数高效微调方法, 在保持模型性能的同时, 进一步压缩可训练参数规模, 实现轻量化微调. 具体而言, 首先系统地分析参数共享机制在PEFT中的作用机理, 揭示跨层参数共享在压缩参数规模与保持模型性能之间取得平衡的内在原因. 其次, 从层间关联性出发, 引入中心化核对齐(centered kernel alignment, CKA)指标对层级表征相似性进行量化分析, 并据此设计合理的分组策略; 在此基础上, 设计跨层参数共享机制: 在功能相近的层组内共享一组参数, 并引入可学习缩放系数细粒度刻画层级差异, 实现轻量化微调与适配性能的协同优化. 实验结果表明, 在VTAB基准的19项下游任务中, 所提方法能大幅缩减参数量 (如可将LoRA参数缩减至原来的1/3), 在14个任务上取得最优性能, 其余任务与现有PEFT的表现相当, 进一步验证了本文方法的有效性和实用性.
2026, 35(8):307-318. DOI: 10.15888/j.cnki.csa.010229 CSTR: 32024.14.csa.010229
摘要:软件代码的多样性和复杂性导致代码漏洞检测成为一个亟待解决的难题. 漏洞特征的上下文语义难以通过静态的规则来描述, 也缺乏大量的数据样本学习. 而代码大模型凭借其丰富的预训练知识, 成为解决代码漏洞检测问题的有效途径. 本文提出了一种基于因果联系的漏洞检测多任务微调方法VulDet, 其核心是结合漏洞认知、识别、分析、修复的漏洞检测全流程因果联系, 构建多任务微调体系, 将漏洞领域知识从多维度注入模型, 强化模型检测能力. 具体而言, 该方法基于CWE、CVE等权威数据库拆解漏洞领域知识, 设计覆盖漏洞定义理解、特征识别、成因分析和代码修复的因果递进式微调任务, 采用等权重联合训练, 实现多维度领域知识的有效融合. 在公开数据集上的测试结果显示, 所提方法优于主流基线模型, 显著提升了漏洞检测的精度与可靠性, 验证了该方法的有效性.
2026, 35(8):319-331. DOI: 10.15888/j.cnki.csa.010210 CSTR: 32024.14.csa.010210
摘要:现有的路面裂缝病害检测算法难以充分捕捉细小且不规则裂缝的细节特征, 需进一步提升裂缝检测的精细化程度与工程适用性. 本文提出一种融合裂缝病害领域知识结构化的CLIP与FastSAM图像分割方法. 首先, 构建沥青路面裂缝病害领域知识图, 并设计专门的知识结构化编码器; 随后, 采用两阶段融合策略, 即先利用结构化知识微调CLIP模型以增强其裂缝语义表示能力, 再将知识结构化增强后的CLIP特征嵌入FastSAM中引导裂缝分割检测. 实验结果表明, 知识结构化的CLIP在自建的CBAPDD-30K (custom-built asphalt pavement damage dataset-30K)数据集和公开数据集MSCOCO上均优于现有方法, 显著提升了细粒度语义图像匹配的准确性. 在服务端实验中, 该模型在CBAPDD-30K数据集上的精确率 (91.67%)、召回率 (90.87%)、F1值 (91.27%)及mIoU (81.91%)均优于主流轻量级与多模态模型; 在边缘端部署时, 其在FPS与推理时间上展现出良好的实时性. 该方法实现了检测精度与速度的平衡, 具有较高的工程应用价值.

