نسخة أولية وصول مفتوح
Self-correction Optimization for Interleaved Multimodal Generation
Multimodal large language models (MLLMs) have made significant progress in visual understanding and generation. However, generating interleaved image--text content remains challenging, as it requires tightly integrated multimodal understanding and generation capabilities. Although existing MLLMs provide promising solut …