نسخة أولية وصول مفتوح
What Do Verifiable Rewards Teach Video-Language Models About Time? A Controlled Multi-Model Study
Reinforcement learning from verifiable rewards (RLVR) has produced large reasoning gains in language models, and verifiable video benchmarks make it applicable to causal-temporal video question answering. We study what RLVR teaches video-language models about time. We fine-tune four open models (Qwen3-VL-8B/4B, Qwen2.5 …