Faure, G. J., Wang, H. P., Chen, M. H., & Hsu, W. H. (2026). VETO: Video Efficient Token Optimization for Vision Language Models. https://omanscience.com/en/articles/veto-video-efficient-token-optimization-for-vision-language-models