摘要:伪装目标检测(camouflaged object detection, COD)在计算机视觉领域占据重要地位, 其核心在于精准识别与背景在纹理、颜色等方面高度融合的目标, 这一任务因其广泛的应用前景而备受瞩目. 近年来, 扩散模型在图像生成和去噪方面表现突出, 但其在伪装目标检测任务中的应用尚面临诸多挑战. 现有基于扩散模型的COD方法主要依赖静态空间域条件特征指导去噪过程, 这种方法使得条件特征在全局特征建模能力上存在明显不足, 且无法有效感知扩散时间步的变化. 为了应对这些挑战, 本文提出了一种名为时频增强扩散模型的伪装目标检测(time-frequency enhanced diffusion model for camouflaged object detection, TFD-COD)的方法, 该方法在骨干网络中引入时间嵌入机制, 这种方式可以使得条件特征的提取过程能够敏锐感知扩散时间步的细微变化; 还设计了频域-空间双分支注意力(frequency-spatial dual branch attention, FSBA)模块, 频域分支通过傅里叶变换及自注意力机制, 精准捕捉全局结构信息, 而空间域分支则利用多尺度卷积和自注意力, 建模局部上下文. 两个分支相互协作, 实现了全局与局部特征的协同增强. 此外, TFD-COD还引入了金字塔滤波融合(pyramid filtering fusion, PFF)策略, 利用浅层特征指导深层特征的上采样, 从而实现多级特征的深度融合. 最终, 这些经过精心设计的条件特征被送入扩散模型, 引导其高效去噪. 实验结果显示, TFD-COD在伪装目标检测任务中的表现显著优于现有方法.