الملخص
Multimodal prediction relies on diverse forms of evidence: information repeated across modalities, cues specific to a single source, and complex cross-modal dependencies that emerge only when inputs are considered together. While recent methods promote richer interactions, they lack a principled way to isolate these target-relative contributions within learned continuous representations. We introduce a framework that applies contrastive or masked objectives at intermediate layers, coupled with source-wise invertible normalizing flows and a supervised, low-rank latent variable model. This architecture explicitly factorizes the joint distribution into shared task-relevant variation, modality-specific predictive variation, and task-irrelevant dependence. Drawing connections to prior multimodal learning assumptions, our approach evaluates how modalities independently and jointly contribute to the target. Ultimately, this framework unites intermediate representation learning with structured likelihood-based guidance, offering a practical latent-variable lens for characterizing continuous multimodal interactions. Empirically, we demonstrate the effectiveness of our approach across diverse multimodal benchmarks, showing robust improvements in predictive performance.
الكلمات المفتاحية
الموضوع
بيانات النشر
- المجلة
- غير متاح
- وصول مفتوح
- وصول مفتوح أخضر
اقتبس هذه المقالة
APA 7
Huang, W., Srivastava, S., & Wang, W. (2026). Structured Latent Modeling for Supervised Multimodal Information Decomposition. https://omanscience.com/ar/articles/structured-latent-modeling-for-supervised-multimodal-information-decomposition
MLA 9
Huang, Wanting, et al. "Structured Latent Modeling for Supervised Multimodal Information Decomposition." https://omanscience.com/ar/articles/structured-latent-modeling-for-supervised-multimodal-information-decomposition.
شيكاغو (المؤلف–التاريخ)
Huang, Wanting, Sanvesh Srivastava, and Weiran Wang. 2026. "Structured Latent Modeling for Supervised Multimodal Information Decomposition." https://omanscience.com/ar/articles/structured-latent-modeling-for-supervised-multimodal-information-decomposition.
هارفارد
Huang, W., Srivastava, S. and Wang, W. (2026) 'Structured Latent Modeling for Supervised Multimodal Information Decomposition', Available at: https://omanscience.com/ar/articles/structured-latent-modeling-for-supervised-multimodal-information-decomposition.
فانكوفر
Huang W, Srivastava S, Wang W. Structured Latent Modeling for Supervised Multimodal Information Decomposition. https://omanscience.com/ar/articles/structured-latent-modeling-for-supervised-multimodal-information-decomposition
IEEE
W. Huang, S. Srivastava, and W. Wang, "Structured Latent Modeling for Supervised Multimodal Information Decomposition," https://omanscience.com/ar/articles/structured-latent-modeling-for-supervised-multimodal-information-decomposition.