Wang, Q., Niu, X., Su, M., Zhao, S., Zhu, S., & Wang, H. (2026). SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference. https://omanscience.com/en/articles/sparsedecoding-decoding-aware-pruning-for-accurate-and-efficient-llm-inference