Preprint Open access
SG-Mamba: Sparse Graph-Guided Mamba for Audio-Visual Speech Enhancement
Lightweight audio-visual speech enhancement (AVSE) models face a critical trade-off between computational efficiency and cross-modal alignment accuracy. While simple concatenation lacks relational expressiveness, dense cross-attention incurs computational overhead and is prone to unreliable cross-modal correspondence u …