摘要:基于长视频的微表情定位旨在从长视频序列中精准检测出极短时间内面部微小的肌肉运动. 针对现有方法在处理背景噪声干扰、长程时序依赖建模以及微表情尺度多样性方面的不足, 本文提出一种基于多尺度 Mamba的微表情定位方案. 首先, 通过改进特征金字塔网络, 采用双线性插值策略优化多尺度特征的融合与对齐, 采用卷积块注意力模块优化横向连接, 提取更具判别性的时序特征; 其次, 设计多尺度Mamba适配器, 利用其选择性状态空间机制, 在保持低计算复杂度的同时捕捉长程时序信息, 并结合位置编码增强模型对动作起止边界的感知力; 最后, 采用分类与回归解耦的检测头, 引入变焦损失函数和分布焦点损失函数进行协同优化. 实验结果表明, 本文方法在SAMM-LV数据集上的F1分数达到0.3025, 相较于基准模型提升了102.3%; 而在样本规模较小的CAS(ME)2数据集上亦取得了0.2188的F1分数, 展现出优于多数主流深度学习方法的竞争性能, 验证了该模型在复杂长视频场景下定位微表情的有效性与鲁棒性.