首页 / GGUF

📦 GGUF 是什么?

AI模型的「压缩格式」,就像把照片压缩成JPG

部署与生产

⚡ 一句话秒懂

AI模型的「压缩格式」,就像把照片压缩成JPG

📖 举个故事

小高下载了一个AI模型,原始格式20GB,他的老电脑跑不动。朋友说:「找GGUF格式的版本。」他在Hugging Face上找到同模型的GGUF版,只有6GB。下载后用Ollama加载,竟然在老电脑上流畅运行。GGUF就像照片的JPG格式——虽然压缩了,但看起来差不多,尺寸却小了好几倍。

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

GGUF是本地运行AI模型的首选格式。在Hugging Face搜索模型时,找带「GGUF」标签的版本。例如下载Qwen2的GGUF版:从TheBloke的仓库选择`qwen2-7b.Q4_K_M.gguf`(4bit量化,平衡大小和质量)。用Ollama直接加载:`ollama run qwen2:7b`。也可以用llama.cpp或LM Studio运行。

📚 进阶原理

GGUF(GPT-Generated Unified Format)是llama.cpp项目专为CPU推理设计的模型格式,替代旧版GGML。它将模型权重(量化后)、分词器配置、模型元数据等打包为单一文件。支持多种量化级别(Q2到Q8),内置版本控制和向前兼容。K-quant方法(Q4_K_M、Q5_K_M等)针对不同层采用不同精度,优化质量。

继续学习相关术语