Abstract

Advancing spatial intelligence in Multimodal Large Language Models (MLLMs) is bottlenecked by the scarcity of complex, scalable 3D question-answer (QA) data. While manual annotation is labor-intensive, directly utilizing LLMs to synthesize these QA pairs often fails due to their inherent deficiencies in spatial and geometric computation. We introduce Exemplar2VQA, a scalable exemplar-driven visual question answering generation framework that rapidly synthesizes large-scale spatial QA pairs in simulated environments via multi-agent coding. By equipping collaborative agents with a meticulously designed library of geometric utilities, Exemplar2VQA bypasses LLMs' spatial reasoning flaws through deterministic code execution. Crucially, the framework exhibits remarkable versatility: taking diverse static object-centric spatial query templates as exemplars, it seamlessly and autonomously scales them into massive, high-fidelity synthetic datasets. Fine-tuning Qwen2.5-VL (3B/7B) exclusively on Exemplar2VQA-generated synthetic indoor data yields significant performance improvements across various diverse benchmarks. Furthermore, its effectiveness is not limited to in-domain indoor datasets but also robustly extends to outdoor and mixed-scene benchmarks. These results establish Exemplar2VQA as a scalable and powerful paradigm for bridging the sim-to-real gap in Embodied AI. Our code is at https://github.com/yingjiayu12/Exemplar2VQA

Keywords

Subject

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Ying, J., Tian, Q., Xu, R., Zhu, X., Dong, D., Xu, J., & Tan, X. (2026). Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding. https://omanscience.com/en/articles/exemplar2vqa-a-scalable-exemplar-driven-visual-question-answering-generation-framework-via-multi-agent-coding

MLA 9

Ying, Jiayu, et al. "Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding." https://omanscience.com/en/articles/exemplar2vqa-a-scalable-exemplar-driven-visual-question-answering-generation-framework-via-multi-agent-coding.

Chicago (author–date)

Ying, Jiayu, Qijian Tian, Ruijie Xu, Xinnan Zhu, Daoguo Dong, Jiachen Xu, and Xin Tan. 2026. "Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding." https://omanscience.com/en/articles/exemplar2vqa-a-scalable-exemplar-driven-visual-question-answering-generation-framework-via-multi-agent-coding.

Harvard

Ying, J., Tian, Q., Xu, R., Zhu, X., Dong, D., Xu, J. and Tan, X. (2026) 'Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding', Available at: https://omanscience.com/en/articles/exemplar2vqa-a-scalable-exemplar-driven-visual-question-answering-generation-framework-via-multi-agent-coding.

Vancouver

Ying J, Tian Q, Xu R, Zhu X, Dong D, Xu J, et al. Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding. https://omanscience.com/en/articles/exemplar2vqa-a-scalable-exemplar-driven-visual-question-answering-generation-framework-via-multi-agent-coding

IEEE

J. Ying, Q. Tian, R. Xu, X. Zhu, D. Dong, J. Xu, and X. Tan, "Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding," https://omanscience.com/en/articles/exemplar2vqa-a-scalable-exemplar-driven-visual-question-answering-generation-framework-via-multi-agent-coding.