نسخة أولية وصول مفتوح
OpticalRec: Unified Optical Vision-Language Representation for Multimodal Recommendation
Recent advances in vision-language modeling have substantially improved multimodal encoding, retrieval and reasoning. Yet for multimodal recommendation, encoding rich item vision-language semantic interactions remains a long-standing bottleneck, which hampers accurate item representation learning and user-item matching …