الملخص

Fine-grained mixed-precision quantization promises efficient large language model inference, but local precision choices can conflict with regular GPU storage and computation units. This precision-boundary mismatch limits the translation of compression into practical acceleration. We introduce AlignQuant, a post-training quantization method that uses GPU-compatible two-dimensional weight tiles as the common unit of precision allocation, compact storage, and execution. This shared partition lets precision follow sensitivity within output channels. Joint prefill/decode calibration scores precision reductions using projection-output perturbations weighted by language-model loss gradients under quantized activations. Phase-normalized scores prioritize higher precision for tiles important to either phase under a model-wide weight-storage budget. Each tile stores one selected representation, while phase-specialized kernels reuse the packed model and expand lower-bit weights for INT8 computation with 8-bit activations. Across four LLMs spanning 3B to 14B parameters, AlignQuant achieves up to $2.50\times$ generation speedup over BF16 while preserving model quality. Evaluations further cover three GPUs and contexts up to 64K tokens. These results show that local precision flexibility and regular GPU execution can coexist through a shared tile unit. The implementation is available at https://github.com/HanzhiZhang-Ulrica/AlignQuant.

الكلمات المفتاحية

الموضوع

بيانات النشر

المجلة
غير متاح
وصول مفتوح
وصول مفتوح أخضر

اقتبس هذه المقالة

APA 7

Zhang, H., Zhang, Q., Cao, Q., Fan, H., Huang, Y., Sha, K., & Feng, Y. (2026). AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation. https://omanscience.com/ar/articles/alignquant-tile-aligned-mixed-precision-quantization-for-efficient-llm-generation

MLA 9

Zhang, Hanzhi, et al. "AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation." https://omanscience.com/ar/articles/alignquant-tile-aligned-mixed-precision-quantization-for-efficient-llm-generation.

شيكاغو (المؤلف–التاريخ)

Zhang, Hanzhi, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, and Yunhe Feng. 2026. "AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation." https://omanscience.com/ar/articles/alignquant-tile-aligned-mixed-precision-quantization-for-efficient-llm-generation.

هارفارد

Zhang, H., Zhang, Q., Cao, Q., Fan, H., Huang, Y., Sha, K. and Feng, Y. (2026) 'AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation', Available at: https://omanscience.com/ar/articles/alignquant-tile-aligned-mixed-precision-quantization-for-efficient-llm-generation.

فانكوفر

Zhang H, Zhang Q, Cao Q, Fan H, Huang Y, Sha K, et al. AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation. https://omanscience.com/ar/articles/alignquant-tile-aligned-mixed-precision-quantization-for-efficient-llm-generation

IEEE

H. Zhang, Q. Zhang, Q. Cao, H. Fan, Y. Huang, K. Sha, and Y. Feng, "AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation," https://omanscience.com/ar/articles/alignquant-tile-aligned-mixed-precision-quantization-for-efficient-llm-generation.