首页 / 量化
📉 量化 是什么?
把AI模型「压缩打包」,体积变小跑得更快
⚡ 一句话秒懂
把AI模型「压缩打包」,体积变小跑得更快
📖 举个故事
小陈下载了一个70GB的AI模型,但他的电脑只有16GB内存,根本跑不动。朋友建议他试试量化版本——一种压缩技术。量化后的模型只有20GB,轻松装进他的电脑,运行速度还快了3倍。虽然精度轻微下降了一点,但日常对话根本感受不到差别。小陈感叹:原来模型也能像压缩文件一样瘦身!
💡 类比理解
暂未补充。
🧩 真实例子
暂未补充。
🛠️ 怎么实际使用
量化让普通电脑也能跑大模型。比如Llama 3 70B原始模型需要140GB显存,8bit量化后降到70GB,4bit量化后只要35GB——一张消费级显卡就够了。在Ollama中下载量化版:`ollama run llama3:70b-q4_K_M`,体验和完整版差不多但资源需求大降。部署到移动设备也靠量化。
📚 进阶原理
量化(Quantization)将模型权重从FP32(32位浮点)降低为INT8(8位整数)或INT4(4位整数),显著减少内存占用和计算量。常见量化方法:GPTQ(GPU优化)、GGUF(CPU优化)、AWQ(感知质量优化)、Bitsandbytes(简易量化)。量化精度损失通常小于1%,但模型体积减少50-75%。