الباحثون

Zhongjiang He

المنشورات 1

نسخة أولية وصول مفتوح

MeSD: Multi-Evidence Self-Distillation for VideoLLM

Weijie Zhu, Han Fang, Hanyu Fu وآخرون · 2026

While reinforcement learning with verifiable rewards provides reliable outcome supervision for VideoLLMs, sequence-level rewards offer limited token-level guidance. On-policy self-distillation addresses this limitation by conditioning a self-teacher on privileged information to provide dense token-level supervision. Ho …

المؤلفون المشاركون