题目:Mamba-Stereo: Mamba Regularization for Stereo Matching
时间:2025年7月
期刊:Pattern Recognition
作者:西安交通大学博士生索劭轩,刘金鑫教授,苗慧慧助理教授
简介:在自动驾驶、机器人导航、增强现实(AR)等关键领域,立体匹配网络是深度估计的核心支撑。传统基于图像特征构建的代价体,因难以捕捉全局几何信息,常导致细节丢失、边缘模糊及无纹理区域匹配误差。针对这一问题,西安交通大学机械工程学院研究团队提出一种基于Mamba机制的新型代价体增强模块-Mamba Regularization。该模块可作为“即插即用”组件集成于现有立体匹配网络,在仅增加轻微推理时间的前提下,显著提升网络对复杂场景(如无纹理、遮挡、薄结构区域)的匹配精度,同时具备强跨数据集泛化能力,为实际场景中的立体匹配任务提供高效解决方案。
摘要:立体匹配网络在自动驾驶、机器人导航和 AR等应用中至关重要。传统基于图像特征的代价体难以捕捉全局几何信息,导致细节丢失、边缘模糊及无纹理区域误差。为此,本文提出一种基于Mamba机制的代价体增强模块(Mamba Regularization):将高维代价体展平为一维特征,通过Spatial Mamba Block捕捉全尺度下的长程依赖;同时设计Spatial Residual Convolution(SRC)模块,补偿展平过程中的空间信息损失。在SceneFlow和KITTI基准数据集上的实验表明,Mamba正则化可作为“即插即用”模块,显著提升多种立体匹配网络的性能;虽引入轻微推理时间增加,但实现了精度与计算效率的良好平衡。此外,该模块具备强跨数据集泛化能力及高推理效率,进一步验证了其在实际场景中的有效性。
关键词:图像处理,立体匹配,Mamba机制,正则化,代价体增强,长程依赖建模。
图1:不同正则化模块的视差结果对比。(a)SceneFlow数据集输入左图;(b)IGEV-Stereo中卷积正则化(CR)的视差结果;(c)Mamba正则化(MR)的视差结果。相比卷积机制,Mamba机制使代价体获取更多全局信息,提升对病态区域的表示能力。
一、方法
第一步:整体立体匹配框架与 Mamba正则化模块集成
本文方法基于 IGEV-Stereo架构,核心创新是将原网络的3D卷积正则化模块替换为Mamba正则化模块(图2)。整体流程如下:
1. 特征编码:左 /右图像通过共享权重的编码器提取多尺度视觉特征;
2. 代价体构建:利用特征相关性运算生成初始代价体;
3. 代价体增强:Mamba正则化模块输入多尺度视觉特征与初始代价体,输出富含全局几何信息的增强代价体;
4. 视差回归:增强代价体聚合生成初始视差图,再与相关性体积、上下文特征拼接后,通过 GRU解码得到最终视差。
图2:方法整体架构。Mamba正则化模块(蓝色框)替换IGEV-Stereo的3D正则化模块,以低计算开销显著提升性能,输入多尺度视觉特征与代价体,输出增强全局几何信息的代价体。
第二步:Mamba正则化模块的核心组件设计
Mamba正则化模块由4个关键组件构成(图3),协同实现代价体增强:

图3:Mamba正则化模块细节。(a)Mamba正则化模块整体结构;(b)Spatial Mamba块架构;(c)ST-Mamba及其扫描模式。
图4:SRC模块架构。输入 3D特征经双卷积模块处理后求和,结合残差连接提升空间特征提取能力。
二、实验

1. 消融实验:模块有效性与通用性
有效性验证(表 1):以IGEV-Stereo为基线,仅添加Spatial Mamba块(SPM)时,EPE从0.479降至0.459,参数数略有减少;叠加SRC模块后,EPE进一步降至0.451,推理时间仅增加0.02s(960×540输入),验证模块对精度与效率的平衡作用。
通用性验证(表 2):将Mamba正则化集成于4种主流立体匹配网络DeepPrunerBest、MobileStereoNet、IGEV-Stereo、Selective-IGEV,所有模型EPE均显著下降,如MobileStereoNet从0.80降至0.75,参数与推理时间增幅可控,证明“即插即用”特性。
表1 SceneFlow测试集上的模块有效性消融
表2 SceneFlow测试集上的模块通用性消融
2. 病态区域性能验证
边缘与非边缘区域(表 3):在SceneFlow中,Mamba-IGEV相比IGEV-Stereo,边缘区域EPE降低7.8%(2.30→2.12),>1px误差降低11.8%(23.55→20.76);非边缘区域性能同步提升,证明模块对细节区域的优化作用。
反光区域(表 4):在KITTI 2012反光区域(典型病态区域),Mamba-Selective-IGEV相比Selective-IGEV,2-all误差从7.84降至7.68,3-noc误差从3.79降至3.74,验证对复杂纹理区域的鲁棒性。
表3 SceneFlow测试集上的边缘区域效果对比
表4 SceneFlow测试集上的反光区域效果对比
3. 与 SOTA方法对比
SceneFlow(表5):Mamba-Selective-IGEV实现EPE=0.42(SOTA),优于RAFT-Stereo(0.61)、IGEV-Stereo(0.47);Mamba-IGEV以12.56M参数实现EPE=0.45,参数效率优于Selective-IGEV(13.14M)。
KITTI(表6):Mamba-Selective-IGEV在KITTI 2012上2-all误差1.99%(优于Selective-IGEV的2.05%),KITTI 2015上D1-fg误差2.49%(优于Selective-IGEV的2.61%),且参数数未显著增加。
表5 SceneFlow测试集上与SOTA算法对比
图5:SceneFlow定性对比。Mamba模块提升无纹理、薄结构区域的视差精度。
表6 KITTI测试集上与SOTA算法对比
图6:KITTI定性对比。Mamba增强后的模型在弱纹理、边缘区域表现更优,视差连续性显著提升。
4. 零样本泛化能力
跨数据集验证(表 7):仅在SceneFlow(合成数据)上训练的模型,测试于Middlebury 2014(室内)与ETH3D(灰度):Mamba-IGEV在Middlebury Full分辨率下2px误差14.7%(优于IGEV-Stereo的15.2%),ETH3D 1px误差3.5%(与IGEV-Stereo相当),证明强泛化能力。
表7泛化能力验证
图7:跨数据集泛化结果。前两行 ETH3D结果,后几行Middlebury 2014结果,Mamba增强模型在真实场景中仍保持高精度。
【作者简介】:
索劭轩(第一作者),西安交通大学机械工程学院博士在读,主要研究方向为:计算机视觉,三维空间感知以及具身智能。
刘金鑫,西安交通大学机械工程学院教授。国家级青年人才,航天制造与信息工程研究所所长。主要研究方向为:空天推进系统建模、控制与智能化,太空智能制造新模式与关键技术。
苗慧慧,西安交通大学机械工程学院助理教授,主要研究方向为:复杂制造过程监测、诊断,高维数据建模方法。