Authors

Ziyang Cheng

Publications 1

Preprint Open access

Text-Centric Post-Training for Omni-Modal Reasoning

Improving joint audio-visual reasoning in Omni Large Language Models typically incurs substantial data construction and training costs. Our diagnostics reveal multi-hop reasoning difficulties despite correct answers to all corresponding single-hop questions and suggest partial decoupling in the local optimization of pe …

Co-authors