本文只比较模型权重、激活和 KV Cache 的量化方案;推理部署、微调和智能体编排分别见对应专题文章。
量化框架对比
| 框架/方法 | 核心技术亮点 | 量化精度支持 | 精度损失 | 易用性 | 典型速度/显存收益 | 典型适用场景 | 主要短板 |
|---|
| GPTQ | 层级后训练量化(one-shot) | INT4 / INT3 / INT2 | 较小 | 中等 | 极高(2-4×) | 权重量化后离线部署 | 不支持动态量化、对称性要求高 |
| AWQ | 激活感知权重量化 | INT4 主力 | 极小(SOTA之一) | 高 | 高 | 高精度 INT4 需求场景 | 主要针对权重量化 |
| bitsandbytes | NF4 / FP4 + 双重量化 | 8bit / 4bit(NF4) | 小~中等 | 高(HF 集成) | 中~高 | 训练时量化 + 推理(QLoRA 常用) | 推理速度不如专用内核 |
| llama.cpp / GGUF | 混合精度 + k-quants(Q4_K_M 等) | Q8_0 ~ Q2_K | 中等~较大 | 中等 | 高(CPU/GPU 均可) | 本地/边缘/低配机器量化部署 | 精度损失相对明显 |
| HQQ | Half-Quadratic Quantization | INT4/2bit 等 | 极小 | 中等 | 很高 | 追求极致低比特高精度场景 | 生态尚在快速发展 |
| llm-compressor | vLLM官方压缩库,支持混合精度、KV Cache/Attention量化 | FP8/NVFP4/Mixed 等 | 极小 | 高(与vLLM无缝) | 极高 | vLLM生产部署优化、MoE/大模型 | 主要服务vLLM生态 |
量化框架推荐
- 追求最高精度 + INT4 推理 → 首选 AWQ
- 需要极致低比特(2bit/3bit)且精度尽量高 → 试试 HQQ
- QLoRA 微调时加载模型 → 首选 bitsandbytes(与 HF 生态最无缝)
- 本地/边缘设备 / CPU / 多平台部署 → 首选 llama.cpp GGUF(Q4_K_M / Q5_K_M 最常用)
- 希望一次性量化好后长期离线使用 → GPTQ(特别适合大模型)
- vLLM生产优化 → llm-compressor(混合精度/KV量化强)
- Apple Silicon 本地推理亦可看 mlx-lm / Ollama(MLX)/oMLX
过时项目(存量)
| 项目 | 状态 | 处理建议 |
|---|
| AutoAWQ | 上游曾停更并存在归档风险 | 新项目优先使用 AWQ 官方路径或 vLLM 生态;存量项目先锁定版本 |
| 相关主题:项目选型。 | | |