首页 / 量化

📉 量化 是什么?

把AI模型「压缩打包」,体积变小跑得更快

部署与生产

⚡ 一句话秒懂

把AI模型「压缩打包」,体积变小跑得更快

📖 举个故事

小陈下载了一个70GB的AI模型,但他的电脑只有16GB内存,根本跑不动。朋友建议他试试量化版本——一种压缩技术。量化后的模型只有20GB,轻松装进他的电脑,运行速度还快了3倍。虽然精度轻微下降了一点,但日常对话根本感受不到差别。小陈感叹:原来模型也能像压缩文件一样瘦身!

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

量化让普通电脑也能跑大模型。比如Llama 3 70B原始模型需要140GB显存,8bit量化后降到70GB,4bit量化后只要35GB——一张消费级显卡就够了。在Ollama中下载量化版:`ollama run llama3:70b-q4_K_M`,体验和完整版差不多但资源需求大降。部署到移动设备也靠量化。

📚 进阶原理

量化(Quantization)将模型权重从FP32(32位浮点)降低为INT8(8位整数)或INT4(4位整数),显著减少内存占用和计算量。常见量化方法:GPTQ(GPU优化)、GGUF(CPU优化)、AWQ(感知质量优化)、Bitsandbytes(简易量化)。量化精度损失通常小于1%,但模型体积减少50-75%。

继续学习相关术语