LLM 推理太贵?显存不够?量化是最直接的方案。INT8 省一半显存,INT4 省四分之三,但效果损失多少?怎么选?一篇讲透。
一、量化基础
1.1 什么是量化
FP32(32位浮点)→ INT8(8位整数)→ INT4(4位整数)
模型显存对比(7B 模型):
FP32: 28 GB (4 bytes × 7B)
FP16: 14 GB (2 bytes × 7B)
INT8: 7 GB (1 byte × 7B)
INT4: 3.5 GB (0.5 bytes × 7B)
→ INT4 量化后,7B 模型只需 3.5GB 显存
→ 一张 4090(24GB)可以跑 70B 模型的 INT4 量化版
2026/6/27大约 7 分钟