Abstract

Audio-Visual Semantic Segmentation (AVSS) aims to identify, segment, and classify sound-emitting objects in video frames. Previous Transformer-based AVSS approaches largely inherit design principles from image segmentation models. Recent studies show that these image segmentation models contain redundant components that contribute little to the segmentation performance. Following this insight, we propose Encoder-only Audio-Visual Segmentation (EASE). EASE runs at up to 365 FPS, 3x faster than prior State-of-the-Art (SotA) AVS models at comparable accuracy, and trains in under 11 GPU-hours. Furthermore, we achieve SotA AVSS performance across different backbones and input resolutions. Our results demonstrate that AVSS can be both simpler and faster, providing a scalable foundation for future research and real-time applications. Code, model weights, and samples are available at https://ease-avs.notion.site

Keywords

Subject

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Viertola, I., Iashin, V., Tötterström, S., & Rahtu, E. (2026). Less is More: Encoder-only Audio-Visual Segmentation. https://omanscience.com/en/articles/less-is-more-encoder-only-audio-visual-segmentation

MLA 9

Viertola, Ilpo, et al. "Less is More: Encoder-only Audio-Visual Segmentation." https://omanscience.com/en/articles/less-is-more-encoder-only-audio-visual-segmentation.

Chicago (author–date)

Viertola, Ilpo, Vladimir Iashin, Sophie Tötterström, and Esa Rahtu. 2026. "Less is More: Encoder-only Audio-Visual Segmentation." https://omanscience.com/en/articles/less-is-more-encoder-only-audio-visual-segmentation.

Harvard

Viertola, I., Iashin, V., Tötterström, S. and Rahtu, E. (2026) 'Less is More: Encoder-only Audio-Visual Segmentation', Available at: https://omanscience.com/en/articles/less-is-more-encoder-only-audio-visual-segmentation.

Vancouver

Viertola I, Iashin V, Tötterström S, Rahtu E. Less is More: Encoder-only Audio-Visual Segmentation. https://omanscience.com/en/articles/less-is-more-encoder-only-audio-visual-segmentation

IEEE

I. Viertola, V. Iashin, S. Tötterström, and E. Rahtu, "Less is More: Encoder-only Audio-Visual Segmentation," https://omanscience.com/en/articles/less-is-more-encoder-only-audio-visual-segmentation.