Shen, X., Lyu, J., Hwang, S., Yao, H., Patel, S., Zhang, Z., & Wobbrock, J. O. (2026). Can Vision-Language Models Analyze Human-Centered Video? Mapping Model Capabilities and Human-AI Collaborative Workflows. https://omanscience.com/ar/articles/can-vision-language-models-analyze-human-centered-video-mapping-model-capabilities-and-human-ai-collaborative-workflows