نسخة أولية وصول مفتوح
Strong Helps Weak: Directional Cross-Modal Alignment Transfer in Multi-modal LLMs
Multi-modal large language models (MLLMs) achieve strong modality understanding by pairing a large language model (LLM) with an encoder for a target modality such as vision, video, or audio. However, improving an MLLM's capability for a given modality typically requires additional training on large modality-specific da …