Abstract
Large Vision-Language Models (LVLMs) face significant computational inefficiencies caused by the large number of visual tokens. Existing visual token pruning methods mainly focus on either retaining individually important tokens or selecting mutually diverse ones. In this work, we revisit visual token pruning from a coverage perspective and formulate it as a biased attention coverage maximization problem. The key idea is to select a compact token subset whose encoder-side outgoing attention can jointly cover the image while assigning higher coverage priority to more informative regions. From this perspective, we propose ACPruner, a training-free visual token pruning framework for efficient LVLM inference. ACPruner first estimates token importance by combining intra-modal saliency and inter-modal relevance, then derives token-wise coverage from attention patterns within the vision encoder, and finally performs greedy selection to maximize the proposed coverage objective. Extensive experiments across multiple LVLM backbones, including LLaVA-1.5-7B/13B, LLaVA-NeXT-7B/13B, Qwen2.5-VL-7B, and LLaVA-OneVision-7B, show that ACPruner consistently achieves strong performance retention while delivering substantial end-to-end inference speedups.
Keywords
Subject
Publication details
- Journal
- Not available
- Open access
- Green open access
Cite this article
APA 7
Li, X., Liang, Y., Zheng, Y., Liu, Z., Chen, X., Chen, H., Zhu, R., Shi, F., & Xue, X. (2026). ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs. https://omanscience.com/en/articles/acpruner-visual-token-pruning-as-biased-attention-coverage-maximization-in-lvlms
MLA 9
Li, Xu, et al. "ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs." https://omanscience.com/en/articles/acpruner-visual-token-pruning-as-biased-attention-coverage-maximization-in-lvlms.
Chicago (author–date)
Li, Xu, Yuxuan Liang, Yi Zheng, Zhe Liu, Xiaolei Chen, Haotian Chen, Rui Zhu, Fan Shi, and Xiangyang Xue. 2026. "ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs." https://omanscience.com/en/articles/acpruner-visual-token-pruning-as-biased-attention-coverage-maximization-in-lvlms.
Harvard
Li, X., Liang, Y., Zheng, Y., Liu, Z., Chen, X., Chen, H., Zhu, R., Shi, F. and Xue, X. (2026) 'ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs', Available at: https://omanscience.com/en/articles/acpruner-visual-token-pruning-as-biased-attention-coverage-maximization-in-lvlms.
Vancouver
Li X, Liang Y, Zheng Y, Liu Z, Chen X, Chen H, et al. ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs. https://omanscience.com/en/articles/acpruner-visual-token-pruning-as-biased-attention-coverage-maximization-in-lvlms
IEEE
X. Li, Y. Liang, Y. Zheng, Z. Liu, X. Chen, H. Chen, R. Zhu, F. Shi, and X. Xue, "ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs," https://omanscience.com/en/articles/acpruner-visual-token-pruning-as-biased-attention-coverage-maximization-in-lvlms.