الباحثون

Qimin Wu

المنشورات 1

نسخة أولية وصول مفتوح

Text-Centric Post-Training for Omni-Modal Reasoning

Ziyang Cheng, Yuhao Wang, Hongcheng Liu وآخرون · 2026

Improving joint audio-visual reasoning in Omni Large Language Models typically incurs substantial data construction and training costs. Our diagnostics reveal multi-hop reasoning difficulties despite correct answers to all corresponding single-hop questions and suggest partial decoupling in the local optimization of pe …

المؤلفون المشاركون