Preprint Open access
Beyond Binary Preferences: Graded Preference Optimization for Limb-Motion Captioning
Vision-Language Models (VLMs) can generate rich video captions, yet often misidentify which person performs an action or which limb is involved, particularly across camera cuts. Improving these details requires evaluation and training that distinguish missing information from incorrect assertions. We introduce FlexBenc …