LLM 权重量化上线生产实战:用 Calibration Set、FP8/W4A16 双轨基准与 Quality Gate 防止质量回退
大模型权重量化不能只看显存下降。本文结合 vLLM、LLM Compressor 与 TensorRT-LLM,给出校准集选择、FP8/W4A16 双轨基准、硬件匹配、质量门禁与灰度回滚的完整生产上线方法。
共 2 篇文章
大模型权重量化不能只看显存下降。本文结合 vLLM、LLM Compressor 与 TensorRT-LLM,给出校准集选择、FP8/W4A16 双轨基准、硬件匹配、质量门禁与灰度回滚的完整生产上线方法。
本文系统拆解 LLM 量化的生产工程逻辑,从 AWQ、GPTQ、SmoothQuant、FP8、INT4、KV cache 量化、校准数据、硬件 kernel 到质量回归测试,帮助团队判断大模型推理降本时如何在显存、延迟、吞吐和准确率之间做可靠取舍。