Abstract

Single-image, multi-image, and video deep research require different visual operations but share a workflow of visual grounding, external retrieval, and fact composition. A key challenge is to preserve the dependencies linking localized visual anchors, entity relations, source-supported facts, and answer-producing operations. We introduce OneSearch-VL, a unified agent centered on the Visually Grounded Evidence Graph (VGEG), which encodes these dependencies as a shared task-level reference for data construction, process supervision, and operation-level evaluation. Our VGEG-based data engine constructs and verifies multi-image and video questions and filters expert trajectories. Using these data, we assemble OneSearch-VL-SFT-110K and OneSearch-VL-RL-10K for SFT and RL, respectively. We further derive the Evidence-aware Visual-Grounded Rubric reward (EVGR) from VGEG annotations to supervise evidence traceability and visual grounding during RL. For fine-grained evaluation, we construct OneSearch-MI-Bench and OneSearch-Video-Bench, organizing questions by the research operations encoded in their VGEGs. Experiments show that OneSearch-VL-8B improves over Qwen3-VL-8B with tool access by 20.2 and 17.6 percentage points on the two new benchmarks, respectively, while also achieving substantial gains across 7 image benchmarks and VideoDR. Project repository: https://github.com/appletea233/OneSearch-VL

Keywords

Subject

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Li, H., Zhang, M., Feng, K., Chen, S., Zheng, D., Li, H., Yu, H., Chen, Z., Guo, Z., Zhang, R., Huang, S., Hui, T., Huang, L., & Liu, S. (2026). OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video. https://omanscience.com/en/articles/onesearch-vl-unified-multimodal-deep-research-agent-for-image-and-video

MLA 9

Li, Hongyu, et al. "OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video." https://omanscience.com/en/articles/onesearch-vl-unified-multimodal-deep-research-agent-for-image-and-video.

Chicago (author–date)

Li, Hongyu, Manyuan Zhang, Kaituo Feng, Shu Chen, Dian Zheng, Hao Li, Hao Yu, Zhangquan Chen, Zoey Guo, Ray Zhang, Shaofei Huang, Tianrui Hui, Linjiang Huang, and Si Liu. 2026. "OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video." https://omanscience.com/en/articles/onesearch-vl-unified-multimodal-deep-research-agent-for-image-and-video.

Harvard

Li, H., Zhang, M., Feng, K., Chen, S., Zheng, D., Li, H., Yu, H., Chen, Z., Guo, Z., Zhang, R., Huang, S., Hui, T., Huang, L. and Liu, S. (2026) 'OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video', Available at: https://omanscience.com/en/articles/onesearch-vl-unified-multimodal-deep-research-agent-for-image-and-video.

Vancouver

Li H, Zhang M, Feng K, Chen S, Zheng D, Li H, et al. OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video. https://omanscience.com/en/articles/onesearch-vl-unified-multimodal-deep-research-agent-for-image-and-video

IEEE

H. Li, M. Zhang, K. Feng, S. Chen, D. Zheng, H. Li, H. Yu, Z. Chen, Z. Guo, R. Zhang, S. Huang, T. Hui, L. Huang, and S. Liu, "OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video," https://omanscience.com/en/articles/onesearch-vl-unified-multimodal-deep-research-agent-for-image-and-video.