模型量化是一种降低神经网络参数和计算精度的优化技术,通过将FP32、FP16等高精度数据转换为INT8、INT4等低精度格式,减少模型存储空间和推理计算开销。量化后模型通常能够显著降低显存占用,提高推理吞吐量,并降低部署成本。根据实施方式不同,可分为训练后量化(PTQ)和量化感知训练(QAT)。在保证精度损失可接受的前提下,量化已成为大模型推理优化的重要技术手段。
FAQ DETAIL