الباحثون

Mingxuan Xie

المنشورات 1

نسخة أولية وصول مفتوح

Seeing and Solving Are Not Enough for Vision-Language Models

Ziheng Wang, Mingxuan Xie, Yilin Liu وآخرون · 2026

Vision-language models (VLMs) answer visual questions by combining visual information extraction with downstream problem solving. We investigate a fundamental question: Does an incorrect answer necessarily reflect a failure in visual extraction or problem solving? A model may succeed at both abilities when tested separ …

المؤلفون المشاركون