الباحثون

Zaiquan Yang

المنشورات 2

نسخة أولية وصول مفتوح

Beyond Entropy: Self-Diagnostic Multi-Role Token Optimization for Video Reasoning

Yudong Han, Yong Wang, Zaiquan Yang وآخرون · 2026

Reinforcement learning with verifiable rewards has substantially advanced multimodal reasoning, yet it remains fundamentally limited by ambiguous token-level credit assignment. While high-entropy token heuristics encourage possibility exploration, naively extending them to video reasoning tends to induce lengthy reason …

المؤلفون المشاركون