الملخص
Active speaker detection (ASD) requires reliable association between visible faces and acoustic speech, yet existing systems often degrade under challenging domains or incomplete observations. We introduce ROAM-ASD, a robust audiovisual framework that jointly models audio, full-face, and fine-grained mouth representations. A unified joint self-attention mechanism processes all input streams together with modality-agnostic query tokens, enabling direct interaction among available modality inputs. Modality dropout further improves robustness when input streams are unavailable. ROAM-ASD achieves state-of-the-art performance across five ASD benchmarks: 98.8% mAP on WASD, 87.9% on UniTalk, 96.5% on AVA, 99.3% on ASW, and 98.2% on Talkies, improving over previous best systems by 5.1, 4.7, 0.9, 1.0, and 2.1 mAP points, respectively. ROAM-ASD also substantially improves zero-shot cross-dataset generalization and remains robust to missing observations.
الكلمات المفتاحية
الموضوع
بيانات النشر
- المجلة
- غير متاح
- وصول مفتوح
- وصول مفتوح أخضر
اقتبس هذه المقالة
APA 7
Wang, P., & Van Hamme, H. (2026). ROAM-ASD: Robust Open-World Active Speaker Detection with Flexible Multimodal Fusion. https://omanscience.com/ar/articles/roam-asd-robust-open-world-active-speaker-detection-with-flexible-multimodal-fusion
MLA 9
Wang, Pu, and Hugo Van Hamme. "ROAM-ASD: Robust Open-World Active Speaker Detection with Flexible Multimodal Fusion." https://omanscience.com/ar/articles/roam-asd-robust-open-world-active-speaker-detection-with-flexible-multimodal-fusion.
شيكاغو (المؤلف–التاريخ)
Wang, Pu, and Hugo Van Hamme. 2026. "ROAM-ASD: Robust Open-World Active Speaker Detection with Flexible Multimodal Fusion." https://omanscience.com/ar/articles/roam-asd-robust-open-world-active-speaker-detection-with-flexible-multimodal-fusion.
هارفارد
Wang, P. and Van Hamme, H. (2026) 'ROAM-ASD: Robust Open-World Active Speaker Detection with Flexible Multimodal Fusion', Available at: https://omanscience.com/ar/articles/roam-asd-robust-open-world-active-speaker-detection-with-flexible-multimodal-fusion.
فانكوفر
Wang P, Van Hamme H. ROAM-ASD: Robust Open-World Active Speaker Detection with Flexible Multimodal Fusion. https://omanscience.com/ar/articles/roam-asd-robust-open-world-active-speaker-detection-with-flexible-multimodal-fusion
IEEE
P. Wang, and H. Van Hamme, "ROAM-ASD: Robust Open-World Active Speaker Detection with Flexible Multimodal Fusion," https://omanscience.com/ar/articles/roam-asd-robust-open-world-active-speaker-detection-with-flexible-multimodal-fusion.