نسخة أولية وصول مفتوح
Region-Aware CLS Token Augmentation for Fine-Grained Image Retrieval
Image retrieval methods often rely on a single global semantic descriptor extracted from an image, e.g., the [CLS] token in vision transformers. However, trying to squeeze all the semantic information of an image into a single descriptor can hurt downstream retrieval performance, especially for fine-grained retrieval t …